Aktuelle RAG-Systeme und Parser-Pipelines (GitHub)

In diesem Artikel stellen wir die neuesten und vielversprechendsten RAG-Systeme und Parser-Pipelines vor, die auf GitHub veröffentlicht wurden. Diese Projekte bieten innovative Lösungen für die Verarbeitung und Analyse von Dokumenten, die lokal betrieben werden können und dabei die Datenschutzanforderungen erfüllen.
docling-Studio (9/10)
Repository: scub-france/docling-Studio
Bewertung: RAG-Kern 3/3 | Dokumente 2/2 | Selfhosting 2/2 | Innovation 1/2 | Reife 1/1 = 9/10
Was es macht: Ein visuelles Dokumentanalyse-Studio, das die Extraktion von Text, Tabellen und Bounding Boxes ermöglicht. Die extrahierten Daten können in OpenSearch und Neo4j indiziert werden.
Warum relevant: Lokal betreibbar, unterstützt verschiedene Dokumentformate und bietet eine benutzerfreundliche Oberfläche für die Dokumentanalyse.
flexible-graphrag (8/10)
Repository: stevereiner/flexible-graphrag
Bewertung: RAG-Kern 3/3 | Dokumente 2/2 | Selfhosting 2/2 | Innovation 1/2 | Reife 0/1 = 8/10
Was es macht: Ein flexibles RAG-System, das verschiedene Datenquellen, Graph-DBs und Vector-DBs unterstützt. Es bietet automatische Synchronisierung, Ontologie-Bau und AI-Chat-Funktionalitäten.
Warum relevant: Lokal betreibbar, unterstützt eine Vielzahl von Datenquellen und bietet erweiterte Funktionen wie Ontologie-Bau und automatische Synchronisierung.
chunky (8/10)
Repository: GiovanniPasq/chunky
Bewertung: RAG-Kern 3/3 | Dokumente 2/2 | Selfhosting 2/2 | Innovation 1/2 | Reife 0/1 = 8/10
Was es macht: Ein Open-Source-Toolkit für zuverlässige RAG-Pipelines. Es konvertiert PDFs in Markdown, bereinigt Dokumente, inspiziert Chunks und bereichert Metadaten für LLM-Anwendungen.
Warum relevant: Lokal betreibbar, unterstützt verschiedene Dokumentformate und bietet Tools zur Chunk-Validierung und -Bereicherung.
self-hosted-ai-stack (8/10)
Repository: hwdsl2/self-hosted-ai-stack
Bewertung: RAG-Kern 2/3 | Dokumente 1/2 | Selfhosting 2/2 | Innovation 2/2 | Reife 1/1 = 8/10
Was es macht: Ein vollständiger, lokal betriebener AI-Stack mit Docker Compose, der Ollama, LiteLLM, Whisper und andere Tools umfasst. Es bietet NVIDIA CUDA-Beschleunigung und optional HTTPS.
Warum relevant: Lokal betreibbar, umfasst eine Vielzahl von AI-Tools und bietet hohe Flexibilität und Leistung.
unified-kg-rag-on-aws (7/10)
Repository: awslabs/unified-kg-rag-on-aws
Bewertung: RAG-Kern 3/3 | Dokumente 2/2 | Selfhosting 0/2 | Innovation 1/2 | Reife 1/1 = 7/10
Was es macht: Ein AWS-native RAG-Framework, das zwei Graph-Retrieval-Methodologien vereint: Microsoft GraphRAG und LightRAG. Es unterstützt Multi-Hop-QA, inkrementelles Indizieren und mehrsprachige Anwendungen.
Warum relevant: Hohe Reife und Innovation, aber nur als SaaS-Lösung verfügbar.
quarkus-docling (5/10)
Repository: quarkiverse/quarkus-docling
Bewertung: RAG-Kern 2/3 | Dokumente 1/2 | Selfhosting 1/2 | Innovation 1/2 | Reife 0/1 = 5/10
Was es macht: Eine Quarkus-Erweiterung, die die Verarbeitung und Parsen von Dokumenten vereinfacht. Es unterstützt verschiedene Formate und bietet nahtlose Integrationen in den gen-AI-Ökosystem.
Warum relevant: Lokal betreibbar, aber mit begrenzter Funktionalität und Reife.
Quelle: GitHub Search API