Aktuelle RAG-Systeme und Parser-Pipelines (GitHub)

In diesem Artikel stellen wir eine Auswahl der aktuellsten und vielversprechendsten RAG-Systeme und Parser-Pipelines auf GitHub vor. Diese Projekte bieten innovative Lösungen für die Verarbeitung und Analyse von Dokumenten und sind in verschiedenen Stadien der Reife.
flexible-graphrag (9/10)
Repository: stevereiner/flexible-graphrag
Bewertung: RAG-Kern 3/3 | Dokumente 2/2 | Selfhosting 2/2 | Innovation 2/2 | Reife 0/1 = 9/10
Was es macht: Ein umfassendes RAG-System, das verschiedene Graph- und Vektordatenbanken unterstützt, inklusive Alfresco, ArcadedB, Neo4j und mehr. Es bietet automatische Synchronisierung, Ontologien, LLMs, und mehr.
Warum relevant: Das Projekt ist sehr innovativ und bietet eine breite Palette von Funktionen, die es zu einer vielseitigen Lösung machen. Es ist self-hostbar und unterstützt eine Vielzahl von Datenquellen.
self-hosted-ai-stack (8/10)
Repository: hwdsl2/self-hosted-ai-stack
Bewertung: RAG-Kern 2/3 | Dokumente 2/2 | Selfhosting 2/2 | Innovation 2/2 | Reife 1/1 = 8/10
Was es macht: Ein vollständiger self-hostbarer AI-Stack, der Ollama, LiteLLM, Whisper, Embeddings, Docling und MCP Gateway umfasst. Es bietet lokale Verarbeitung, NVIDIA CUDA-Beschleunigung und optional HTTPS.
Warum relevant: Dieses Projekt ist ideal für Entwickler, die eine umfassende, lokal betriebene AI-Infrastruktur benötigen. Es ist gut dokumentiert und aktiv gepflegt.
docker-docling (8/10)
Repository: hwdsl2/docker-docling
Bewertung: RAG-Kern 2/3 | Dokumente 2/2 | Selfhosting 2/2 | Innovation 1/2 | Reife 1/1 = 8/10
Was es macht: Ein Docker-Image für einen self-hostbaren Docling-Dokumentenparsingserver. Es konvertiert PDF, DOCX, PPTX, HTML und mehr in Markdown/JSON, unterstützt Chunking für RAG und NVIDIA GPU-Beschleunigung.
Warum relevant: Dieses Projekt ist besonders nützlich für die Verarbeitung und Analyse von Dokumenten in verschiedenen Formaten. Es ist leicht zu betreiben und bietet leistungsstarke Funktionen.
unified-kg-rag-on-aws (7/10)
Repository: awslabs/unified-kg-rag-on-aws
Bewertung: RAG-Kern 3/3 | Dokumente 2/2 | Selfhosting 0/2 | Innovation 1/2 | Reife 1/1 = 7/10
Was es macht: Ein AWS-native RAG-Framework, das zwei Graph-Retrieval-Methoden (Microsoft GraphRAG und LightRAG) vereint. Es unterstützt Multi-Hop-QA, inkrementelles Indexing und mehrsprachige Dokumente.
Warum relevant: Dieses Projekt ist eine ausgezeichnete Wahl für Unternehmen, die bereits in der AWS-Ökosystem investiert haben. Es bietet eine robuste und skalierbare Lösung für RAG-Anwendungen.
ragflow-enterprise (7/10)
Repository: wangchuanbo123/ragflow-enterprise
Bewertung: RAG-Kern 3/3 | Dokumente 1/2 | Selfhosting 1/2 | Innovation 1/2 | Reife 1/1 = 7/10
Was es macht: Ein enterprise-level RAG-System, das auf LangGraph basiert und Hybrid-Retrieval, Reranking, Query Rewriting und inkrementelles Indexing unterstützt.
Warum relevant: Dieses Projekt ist speziell für Unternehmen entwickelt, die eine leistungsstarke und flexible RAG-Lösung benötigen. Es ist gut dokumentiert und bietet fortgeschrittene Funktionen.
quarkus-docling (6/10)
Repository: quarkiverse/quarkus-docling
Bewertung: RAG-Kern 2/3 | Dokumente 2/2 | Selfhosting 1/2 | Innovation 1/2 | Reife 0/1 = 6/10
Was es macht: Ein Quarkus-Extension, das die Verarbeitung und Parsen von Dokumenten vereinfacht, einschließlich fortgeschrittener PDF-Verarbeitung und Integration in den gen-AI-Ökosystem.
Warum relevant: Dieses Projekt ist besonders nützlich für Entwickler, die Quarkus in ihren Projekten verwenden und eine robuste Dokumentenverarbeitung benötigen. Es ist leicht zu integrieren und bietet erweiterte Funktionen.
transmutation (6/10)
Repository: hivellm/transmutation
Bewertung: RAG-Kern 2/3 | Dokumente 2/2 | Selfhosting 1/2 | Innovation 1/2 | Reife 0/1 = 6/10
Was es macht: Ein Rust-basiertes Modul zur Transformation verschiedener Dateiformate in optimierte Text- und Bildausgaben, geeignet für LLM-Verarbeitung und Vektorembeddings.
Warum relevant: Dieses Projekt ist eine leistungsstarke Lösung für die Verarbeitung und Konvertierung von Dokumenten in verschiedenen Formaten. Es ist besonders geeignet für Entwickler, die Rust bevorzugen.
Quelle: GitHub Search API