Aktuelle RAG-Systeme und Parser-Pipelines (GitHub)

In diesem Artikel stellen wir die neuesten und vielversprechendsten RAG-Systeme und Parser-Pipelines vor, die auf GitHub veröffentlicht wurden. Diese Projekte bieten innovative Lösungen für die Verarbeitung und Analyse von Dokumenten und die Integration von KI-Technologien.
flexible-graphrag (9/10)
Repository: stevereiner/flexible-graphrag
Bewertung: RAG-Kern 3/3 | Dokumente 2/2 | Selfhosting 2/2 | Innovation 2/2 | Reife 0/1 = 9/10
Was es macht: Ein umfassendes RAG-System, das verschiedene Graph- und Vektordatenbanken unterstützt, einschließlich Alfresco, Nuxeo, Neo4j und mehr. Es bietet automatische Synchronisierung, Ontologien, LLM-Integration und mehr.
Warum relevant: Das Projekt ist sehr innovativ und bietet eine breite Palette von Funktionen, die es zu einer vielseitigen Lösung machen. Es ist self-hostbar und unterstützt eine Vielzahl von Datenquellen.
self-hosted-ai-stack (8/10)
Repository: hwdsl2/self-hosted-ai-stack
Bewertung: RAG-Kern 2/3 | Dokumente 2/2 | Selfhosting 2/2 | Innovation 2/2 | Reife 1/1 = 8/10
Was es macht: Eine vollständige self-hosted AI-Stack-Lösung, die Ollama, LiteLLM, Whisper und andere Tools umfasst. Es bietet lokale KI-Modelle, Embeddings, Dokumentverarbeitung und mehr.
Warum relevant: Dieses Projekt ist besonders relevant für Benutzer, die eine umfassende, lokal betriebene AI-Infrastruktur benötigen. Es ist gut dokumentiert und aktiv gepflegt.
docker-docling (8/10)
Repository: hwdsl2/docker-docling
Bewertung: RAG-Kern 2/3 | Dokumente 2/2 | Selfhosting 2/2 | Innovation 1/2 | Reife 1/1 = 8/10
Was es macht: Ein Docker-Image für eine self-hosted Docling-Dokumentverarbeitungsserver. Es konvertiert PDF, DOCX, PPTX, HTML und mehr in Markdown/JSON und unterstützt RAG-Funktionen wie Chunking.
Warum relevant: Dieses Projekt ist ideal für Benutzer, die eine leistungsstarke, lokal betriebene Dokumentverarbeitungslösung benötigen. Es ist gut dokumentiert und bietet NVIDIA GPU-Acceleration.
unified-kg-rag-on-aws (7/10)
Repository: awslabs/unified-kg-rag-on-aws
Bewertung: RAG-Kern 3/3 | Dokumente 2/2 | Selfhosting 0/2 | Innovation 1/2 | Reife 1/1 = 7/10
Was es macht: Ein AWS-native RAG-Framework, das zwei Graph-Retrieval-Methodologien vereint: Microsoft GraphRAG und LightRAG. Es unterstützt Multi-hop QA, inkrementelles Indexing und mehrere Sprachen.
Warum relevant: Dieses Projekt ist besonders relevant für Benutzer, die in der AWS-Ökosystem arbeiten und eine robuste RAG-Lösung benötigen. Es ist gut dokumentiert und aktiv gepflegt.
ragflow-enterprise (7/10)
Repository: wangchuanbo123/ragflow-enterprise
Bewertung: RAG-Kern 3/3 | Dokumente 1/2 | Selfhosting 1/2 | Innovation 1/2 | Reife 1/1 = 7/10
Was es macht: Ein enterprise-level RAG-System, das auf LangGraph basiert und hybride Retrieval, Reranking, Query Rewriting und inkrementelles Indexing unterstützt.
Warum relevant: Dieses Projekt ist besonders relevant für Unternehmen, die eine robuste und skalierbare RAG-Lösung benötigen. Es ist gut dokumentiert und aktiv gepflegt.
quarkus-docling (6/10)
Repository: quarkiverse/quarkus-docling
Bewertung: RAG-Kern 2/3 | Dokumente 2/2 | Selfhosting 1/2 | Innovation 1/2 | Reife 1/1 = 6/10
Was es macht: Ein Quarkus-Extension, das Docling verwendet, um Dokumente in verschiedene Formate zu konvertieren und sie für die Verarbeitung durch KI-Modelle bereitzustellen.
Warum relevant: Dieses Projekt ist besonders relevant für Entwickler, die Quarkus verwenden und eine integrierte Dokumentverarbeitungslösung benötigen. Es ist gut dokumentiert und aktiv gepflegt.
transmutation (6/10)
Repository: hivellm/transmutation
Bewertung: RAG-Kern 1/3 | Dokumente 2/2 | Selfhosting 1/2 | Innovation 2/2 | Reife 1/1 = 6/10
Was es macht: Ein Rust-basiertes Modul zur Dokumentkonvertierung, das verschiedene Formate in optimierte Text- und Bildausgaben umwandelt, die für LLM-Verarbeitung und Vektorembeddings geeignet sind.
Warum relevant: Dieses Projekt ist besonders relevant für Benutzer, die eine leistungsstarke und effiziente Dokumentkonvertierungslösung in Rust benötigen. Es ist gut dokumentiert und aktiv gepflegt.
Quelle: GitHub Search API