Aktuelle RAG-Systeme und Parser-Pipelines (GitHub)

In diesem Artikel stellen wir eine Auswahl der aktuellsten und vielversprechendsten RAG-Systeme und Parser-Pipelines vor, die auf GitHub zu finden sind. Diese Projekte bieten innovative Lösungen für die Verarbeitung und Analyse von Dokumenten, die lokal betrieben werden können und eine hohe Reife aufweisen.
flexible-graphrag (9/10)
Repository: stevereiner/flexible-graphrag
Bewertung: RAG-Kern 3/3 | Dokumente 2/2 | Selfhosting 2/2 | Innovation 2/2 | Reife 0/1 = 9/10
Was es macht: Ein flexibles RAG-System, das verschiedene Datenquellen, Graph-DBs und LLMs unterstützt. Es bietet automatische Synchronisierung, Ontologien, und eine Vielzahl von Frontends.
Warum relevant: Die Vielfalt an unterstützten Datenquellen und die Flexibilität in der Architektur machen dieses Projekt zu einer hervorragenden Wahl für komplexe RAG-Anwendungen. Es ist vollständig self-hostbar und innovativ in seiner Ansatzweise.
docling-Studio (8/10)
Repository: scub-france/docling-Studio
Bewertung: RAG-Kern 3/3 | Dokumente 2/2 | Selfhosting 2/2 | Innovation 1/2 | Reife 1/1 = 8/10
Was es macht: Ein visuelles Dokumentanalyse-Studio, das Text, Tabellen und Bounding Boxes extrahiert, chunks, embeds und in OpenSearch und Neo4j indiziert.
Warum relevant: Die visuelle Inspektion und die umfassende Dokumentenverarbeitung machen dieses Tool besonders nützlich für die Entwicklung und Optimierung von RAG-Pipelines. Es ist lokal betreibbar und bietet eine hohe Reife.
chunky (8/10)
Repository: GiovanniPasq/chunky
Bewertung: RAG-Kern 3/3 | Dokumente 2/2 | Selfhosting 2/2 | Innovation 1/2 | Reife 1/1 = 8/10
Was es macht: Ein Open-Source-Toolkit für zuverlässige RAG-Pipelines, das PDFs in Markdown konvertiert, Dokumente bereinigt, Chunks inspiziert und Metadaten bereichert.
Warum relevant: Die umfassenden Funktionen zur Dokumentenverarbeitung und -chunking machen dieses Projekt zu einer wertvollen Ressource für die Entwicklung von RAG-Anwendungen. Es ist lokal betreibbar und bietet eine hohe Reife.
self-hosted-ai-stack (8/10)
Repository: hwdsl2/self-hosted-ai-stack
Bewertung: RAG-Kern 2/3 | Dokumente 2/2 | Selfhosting 2/2 | Innovation 2/2 | Reife 1/1 = 8/10
Was es macht: Ein vollständig self-hostbares AI-Stack mit Docker Compose, das Ollama, LiteLLM, Whisper, Embeddings, Docling und mehr unterstützt.
Warum relevant: Die Kombination verschiedener AI-Tools und die Möglichkeit, alles lokal zu betreiben, machen diesen Stack besonders attraktiv für Entwickler, die auf Datenschutz und Privatsphäre Wert legen. Es ist innovativ und bietet eine hohe Reife.
unified-kg-rag-on-aws (7/10)
Repository: awslabs/unified-kg-rag-on-aws
Bewertung: RAG-Kern 3/3 | Dokumente 2/2 | Selfhosting 1/2 | Innovation 1/2 | Reife 1/1 = 7/10
Was es macht: Ein AWS-native RAG-Framework, das zwei Graph-Retrieval-Methoden auf Amazon Bedrock, Neptune und OpenSearch vereint. Es unterstützt Multi-hop QA, inkrementelles Indexing und mehrere Sprachen.
Warum relevant: Die Integration mit AWS-Diensten und die Unterstützung für Multi-hop QA machen dieses Projekt zu einer interessanten Wahl für Unternehmen, die bereits in der AWS-Ökosystem investiert haben. Es ist teilweise self-hostbar und bietet eine hohe Reife.
quarkus-docling (6/10)
Repository: quarkiverse/quarkus-docling
Bewertung: RAG-Kern 2/3 | Dokumente 2/2 | Selfhosting 1/2 | Innovation 1/2 | Reife 1/1 = 6/10
Was es macht: Ein Quarkus-Extension, das die Verarbeitung und Parsen von Dokumenten vereinfacht, einschließlich fortgeschrittener PDF-Verarbeitung und Integration in das gen AI-Ökosystem.
Warum relevant: Die Integration in Quarkus und die Unterstützung für verschiedene Dokumentformate machen dieses Projekt nützlich für Entwickler, die auf Java und Quarkus arbeiten. Es ist teilweise self-hostbar und bietet eine hohe Reife.
Quelle: GitHub Search API