Aktuelle RAG-Systeme und Parser-Pipelines (GitHub)

In diesem Artikel stellen wir die aktuellsten und vielversprechendsten RAG-Systeme und Parser-Pipelines vor, die auf GitHub zu finden sind. Diese Projekte bieten innovative Lösungen für die Verarbeitung und Analyse von Dokumenten, die lokal betrieben werden können und dabei die Privatsphäre der Nutzer gewährleisten.
flexible-graphrag (9/10)
Repository: stevereiner/flexible-graphrag
Bewertung: RAG-Kern 3/3 | Dokumente 2/2 | Selfhosting 2/2 | Innovation 2/2 | Reife 0/1 = 9/10
Was es macht: Ein umfassendes Toolkit für RAG-Pipelines, das verschiedene Datenquellen wie Alfresco, Nuxeo und Graph-Datenbanken unterstützt. Es bietet automatische Synchronisierung, Wissensgraphen, Ontologien und mehr.
Warum relevant: Die Vielfalt der unterstützten Datenquellen und die Automatisierung machen dieses Projekt besonders wertvoll für Unternehmen, die komplexe Datenlandschaften haben. Es ist vollständig self-hostbar und bietet eine breite Palette an Funktionen.
docling-Studio (8/10)
Repository: scub-france/docling-Studio
Bewertung: RAG-Kern 3/3 | Dokumente 2/2 | Selfhosting 2/2 | Innovation 1/2 | Reife 1/1 = 8/10
Was es macht: Ein visuelles Dokumentanalyse-Studio, das die Konfiguration von Extraktionspipelines, Text- und Tabelleninspektion sowie das Chunking, Embedding und Indexieren von Dokumenten in OpenSearch und Neo4j ermöglicht.
Warum relevant: Die visuelle Interface-Unterstützung und die Selfhosting-Fähigkeit machen dieses Projekt ideal für Teams, die eine intuitive und flexible Lösung für die Dokumentverarbeitung benötigen. Es ist gut dokumentiert und aktiv gepflegt.
chunky (8/10)
Repository: GiovanniPasq/chunky
Bewertung: RAG-Kern 3/3 | Dokumente 2/2 | Selfhosting 2/2 | Innovation 1/2 | Reife 1/1 = 8/10
Was es macht: Ein Open-Source-Toolkit für zuverlässige RAG-Pipelines, das PDFs in Markdown konvertiert, Dokumente bereinigt, Chunks inspiziert und Metadaten bereichert.
Warum relevant: Die umfassende Unterstützung für verschiedene Dokumentformate und die Fähigkeit, Chunking-Strategien zu vergleichen, machen dieses Projekt besonders nützlich für Entwickler, die eine robuste RAG-Pipeline benötigen. Es ist gut dokumentiert und aktiv gepflegt.
self-hosted-ai-stack (7/10)
Repository: hwdsl2/self-hosted-ai-stack
Bewertung: RAG-Kern 2/3 | Dokumente 1/2 | Selfhosting 2/2 | Innovation 1/2 | Reife 1/1 = 7/10
Was es macht: Ein vollständig self-hostbarer AI-Stack mit Docker Compose, der Ollama, LiteLLM, Whisper, WhisperLive, Kokoro, Embeddings, Docling und MCP Gateway unterstützt.
Warum relevant: Die Kombination verschiedener AI-Tools in einem einzigen, leichtgewichtigen Stack macht dieses Projekt ideal für Entwickler, die eine umfassende, lokal betriebene AI-Lösung benötigen. Es ist gut dokumentiert und aktiv gepflegt.
GustoBot (7/10)
Repository: skygazer42/GustoBot
Bewertung: RAG-Kern 2/3 | Dokumente 1/2 | Selfhosting 2/2 | Innovation 2/2 | Reife 1/1 = 7/10
Was es macht: Ein umfassender Multi-Agenten-Kundenservice-Bot, der auf Langraph basiert und Funktionen wie txt2sql, txt2cypher und Lightrag unterstützt.
Warum relevant: Die Integration verschiedener Agenten und die Unterstützung für komplexe Abfragen machen dieses Projekt besonders innovativ. Es ist gut dokumentiert und aktiv gepflegt.
quarkus-docling (6/10)
Repository: quarkiverse/quarkus-docling
Bewertung: RAG-Kern 2/3 | Dokumente 1/2 | Selfhosting 1/2 | Innovation 1/2 | Reife 0/1 = 6/10
Was es macht: Ein Quarkus-Extension, das die Verarbeitung und Parsen von Dokumenten vereinfacht, einschließlich erweiterten PDF-Verständnisses und nahtloser Integration in den gen-AI-Ökosystem.
Warum relevant: Die Integration in Quarkus und die Unterstützung für verschiedene Dokumentformate machen dieses Projekt nützlich für Entwickler, die eine leistungsstarke, lokal betriebene Lösung für Dokumentverarbeitung benötigen. Es ist ein interessantes Projekt, das jedoch noch in der Frühphase ist.
Quelle: GitHub Search API