Aktuelle RAG-Systeme und Parser-Pipelines (GitHub)

In diesem Artikel stellen wir die aktuellsten und vielversprechendsten RAG-Systeme und Parser-Pipelines vor, die auf GitHub entwickelt werden. Diese Projekte bieten innovative Lösungen für die Verarbeitung und Analyse von Dokumenten, wobei sie oft auf lokalen Systemen betrieben werden können, um Datenschutz und Kontrolle zu gewährleisten.
flexible-graphrag (9/10)
Repository: stevereiner/flexible-graphrag
Bewertung: RAG-Kern 3/3 | Dokumente 2/2 | Selfhosting 2/2 | Innovation 2/2 | Reife 0/1 = 9/10
Was es macht: Dieses Projekt kombiniert Python, LlamaIndex, LangChain und Docker Compose, um eine flexible RAG-System zu erstellen. Es unterstützt 15 Property Graph, 4 RDF, 10 Vector, OpenSearch, Elasticsearch, Alfresco und Nuxeo-Datenbanken. Es bietet automatische Synchronisierung, automatisches Erstellen von Wissensgraphen, Ontologien, LLMs, Docling, LlamaParse, LiteParse, GraphRAG, RAG und Hybrid Search. Es verfügt über TypeScript React, Vue und Angular-Frontends sowie einen REST-Service und optionalen Langflow.
Warum relevant: Die Vielfalt der unterstützten Datenquellen und die Flexibilität in der Verarbeitung machen dieses Projekt zu einer innovativen Lösung für komplexe RAG-Anwendungen. Es ist lokal betreibbar und bietet eine breite Palette von Funktionen.
self-hosted-ai-stack (8/10)
Repository: hwdsl2/self-hosted-ai-stack
Bewertung: RAG-Kern 2/3 | Dokumente 2/2 | Selfhosting 2/2 | Innovation 2/2 | Reife 1/1 = 8/10
Was es macht: Dieses Projekt ermöglicht es, eine vollständige, lokal betriebene AI-Stack mit Docker Compose zu bereitstellen. Es umfasst Ollama, LiteLLM, AnythingLLM, Whisper, WhisperLive, Kokoro, Embeddings, Docling und MCP Gateway. Es ist lokal-first, privat standardmäßig und bietet leichte Stack-Konfigurationen, optionales HTTPS und NVIDIA CUDA-Beschleunigung.
Warum relevant: Die Kombination von verschiedenen AI-Tools in einem einzigen, lokal betriebenen Stack macht dieses Projekt zu einer umfassenden Lösung für Entwickler und Unternehmen, die ihre Daten lokal verwalten möchten.
docker-docling (8/10)
Repository: hwdsl2/docker-docling
Bewertung: RAG-Kern 2/3 | Dokumente 2/2 | Selfhosting 2/2 | Innovation 1/2 | Reife 1/1 = 8/10
Was es macht: Dieses Docker-Image bietet einen selbstgehosteten Docling-Dokumentparsingserver. Es konvertiert PDF, DOCX, PPTX, HTML und andere Formate in Markdown/JSON. Es unterstützt synchrone und asynchrone Konvertierung, Chunking für RAG, NVIDIA GPU-Beschleunigung, optionale Web-UI, Offline-Modus und persistenten Modell-Cache.
Warum relevant: Die Fähigkeit, verschiedene Dokumentformate lokal zu verarbeiten und in ein RAG-fähiges Format zu konvertieren, macht dieses Projekt zu einer wertvollen Ressource für Entwickler, die ihre Dokumentverarbeitung selbst kontrollieren möchten.
unified-kg-rag-on-aws (7/10)
Repository: awslabs/unified-kg-rag-on-aws
Bewertung: RAG-Kern 3/3 | Dokumente 2/2 | Selfhosting 0/2 | Innovation 1/2 | Reife 1/1 = 7/10
Was es macht: Dieses AWS-native RAG-Framework vereint zwei Graph-Retrieval-Methoden — Microsoft GraphRAG und LightRAG — auf Amazon Bedrock, Neptune und OpenSearch. Es unterstützt Multi-Hop-QA über Dokumentkorpus, inkrementelles Indexieren und mehrsprachige Unterstützung.
Warum relevant: Die Integration von AWS-Diensten und die Unterstützung von Multi-Hop-QA machen dieses Projekt zu einer leistungsstarken Lösung für Unternehmen, die bereits in der AWS-Ökosystem investiert haben.
ragflow-enterprise (7/10)
Repository: wangchuanbo123/ragflow-enterprise
Bewertung: RAG-Kern 3/3 | Dokumente 1/2 | Selfhosting 1/2 | Innovation 1/2 | Reife 1/1 = 7/10
Was es macht: Dieses Enterprise-Level RAG-System basiert auf LangGraph und bietet hybride Retrieval, Reranking, Query Rewriting und inkrementelles Indexieren.
Warum relevant: Die erweiterten Funktionen wie Reranking und Query Rewriting machen dieses Projekt zu einer robusten Lösung für Unternehmen, die hochgradig personalisierte RAG-Anwendungen benötigen.
quarkus-docling (6/10)
Repository: quarkiverse/quarkus-docling
Bewertung: RAG-Kern 2/3 | Dokumente 2/2 | Selfhosting 1/2 | Innovation 1/2 | Reife 0/1 = 6/10
Was es macht: Docling vereinfacht die Dokumentverarbeitung und unterstützt verschiedene Formate, einschließlich fortgeschrittener PDF-Verarbeitung. Es bietet nahtlose Integrationen mit dem gen AI-Ökosystem.
Warum relevant: Die Unterstützung von fortgeschrittenen PDF-Verarbeitungen und die Integration in das gen AI-Ökosystem machen dieses Projekt zu einer nützlichen Ressource für Entwickler, die Dokumentverarbeitung in ihre Anwendungen integrieren möchten.
transmutation (6/10)
Repository: hivellm/transmutation
Bewertung: RAG-Kern 2/3 | Dokumente 2/2 | Selfhosting 1/2 | Innovation 1/2 | Reife 0/1 = 6/10
Was es macht: Transmutation ist ein Rust-basiertes Modul zur Dokumentkonvertierung, das verschiedene Dateiformate in optimierte Text- und Bildausgaben für LLM-Verarbeitung und Vektorembeddings umwandelt. Es nutzt Docling für fortgeschrittene Dokumentverarbeitung.
Warum relevant: Die Leistungsfähigkeit von Rust und die Unterstützung von verschiedenen Dokumentformaten machen dieses Projekt zu einer effizienten Lösung für die Dokumentverarbeitung in RAG-Anwendungen.
Quelle: GitHub Search API