Aktuelle RAG-Systeme und Parser-Pipelines (GitHub)

In diesem Artikel stellen wir die neuesten Entwicklungen im Bereich RAG-Systeme und Parser-Pipelines vor. Diese Projekte bieten innovative Lösungen für die Verarbeitung und Analyse von Dokumenten, wobei sie oft auf lokalen Systemen betrieben werden können, um Datenschutz und Kontrolle zu gewährleisten.
flexible-graphrag (8/10)
Repository: stevereiner/flexible-graphrag
Bewertung: RAG-Kern 3/3 | Dokumente 2/2 | Selfhosting 2/2 | Innovation 2/2 | Reife 1/1 = 8/10
Was es macht: Ein umfassendes RAG-System, das verschiedene Datenquellen und Datenbanken unterstützt, einschließlich Property Graph, RDF, Vector DBs und mehr. Es bietet automatische Synchronisierung, Wissensgraphen, Ontologien, LLMs, Docling, LlamaParse, LiteParse, GraphRAG, RAG und Hybrid Search. Es ist in Python geschrieben und unterstützt verschiedene Frontends wie TypeScript React, Vue und Angular.
Warum relevant: Dieses Projekt ist besonders relevant, da es eine breite Palette von Funktionen und Datenquellen unterstützt und lokal betrieben werden kann, was die Kontrolle über eigene Daten ermöglicht.
self-hosted-ai-stack (7/10)
Repository: hwdsl2/self-hosted-ai-stack
Bewertung: RAG-Kern 2/3 | Dokumente 2/2 | Selfhosting 2/2 | Innovation 1/2 | Reife 1/1 = 7/10
Was es macht: Ein vollständiger, lokal betriebener AI-Stack, der Ollama, LiteLLM, AnythingLLM, Whisper, WhisperLive, Kokoro, Embeddings, Docling und MCP Gateway umfasst. Es bietet lokale und private AI-Funktionen, NVIDIA CUDA-Beschleunigung und optional HTTPS.
Warum relevant: Dieses Projekt ist ideal für Benutzer, die eine umfassende, lokal betriebene AI-Infrastruktur benötigen, die Datenschutz und Leistung kombiniert.
docker-docling (7/10)
Repository: hwdsl2/docker-docling
Bewertung: RAG-Kern 2/3 | Dokumente 2/2 | Selfhosting 2/2 | Innovation 1/2 | Reife 1/1 = 7/10
Was es macht: Ein Docker-Image für einen selbstgehosteten Docling-Dokumentparsingserver. Es konvertiert PDF, DOCX, PPTX, HTML und mehr in Markdown/JSON, unterstützt Chunking für RAG, NVIDIA GPU-Beschleunigung, optionalen Web-UI, Offline-Modus und persistenten Modell-Cache.
Warum relevant: Dieses Projekt ist besonders nützlich für Benutzer, die eine robuste, lokal betriebene Lösung für die Verarbeitung und Analyse von Dokumenten benötigen.
unified-kg-rag-on-aws (6/10)
Repository: awslabs/unified-kg-rag-on-aws
Bewertung: RAG-Kern 2/3 | Dokumente 1/2 | Selfhosting 1/2 | Innovation 2/2 | Reife 1/1 = 6/10
Was es macht: Ein AWS-native RAG-Framework, das zwei Graph-Retrieval-Methodologien — Microsoft GraphRAG und LightRAG — auf Amazon Bedrock, Neptune und OpenSearch vereint. Es unterstützt Multi-Hop-QA über Dokumentkorpus, inkrementelles Indexieren und mehrsprachige Unterstützung.
Warum relevant: Dieses Projekt ist besonders relevant für Unternehmen, die bereits in der AWS-Ökosystem investiert haben und eine leistungsstarke, skalierbare RAG-Lösung benötigen.
quarkus-docling (5/10)
Repository: quarkiverse/quarkus-docling
Bewertung: RAG-Kern 1/3 | Dokumente 1/2 | Selfhosting 1/2 | Innovation 1/2 | Reife 1/1 = 5/10
Was es macht: Ein Quarkus-Extension, das die Verarbeitung und Parsen verschiedener Dokumentformate vereinfacht, einschließlich fortgeschrittener PDF-Verarbeitung und nahtloser Integration in das gen-AI-Ökosystem.
Warum relevant: Dieses Projekt ist besonders nützlich für Entwickler, die Quarkus verwenden und eine robuste Dokumentverarbeitung in ihre Anwendungen integrieren möchten.
Quelle: GitHub Search API