Aktuelle RAG-Systeme und Parser-Pipelines (GitHub)

In diesem Artikel stellen wir die neuesten Entwicklungen im Bereich RAG-Systeme und Parser-Pipelines vor. Diese Projekte bieten innovative Lösungen für die Verarbeitung und Analyse von Dokumenten, oft in Kombination mit lokalen, selbstgehosteten Systemen.
self-hosted-ai-stack (8/10)
Repository: hwdsl2/self-hosted-ai-stack
Bewertung: RAG-Kern 3/3 | Dokumente 2/2 | Selfhosting 2/2 | Innovation 1/2 | Reife 0/1 = 8/10
Was es macht: Dieses Projekt bietet eine vollständige, selbstgehostete AI-Stack-Lösung mit Docker Compose. Es umfasst Ollama, LiteLLM, AnythingLLM, Whisper, WhisperLive, Kokoro, Embeddings, Docling und MCP Gateway. Die Stack-Lösung ist lokal-first, privat und unterstützt NVIDIA CUDA-Acceleration.
Warum relevant: Ideal für Entwickler und Unternehmen, die eine umfassende, private AI-Infrastruktur aufbauen möchten. Die Unterstützung von verschiedenen LLMs und der Fokus auf Selfhosting machen dieses Projekt besonders wertvoll.
docling-Studio (7/10)
Repository: scub-france/docling-Studio
Bewertung: RAG-Kern 3/3 | Dokumente 2/2 | Selfhosting 2/2 | Innovation 1/2 | Reife 1/1 = 7/10
Was es macht: Docling-Studio ist ein visuelles Dokumentanalyse-Tool, das die Extraktion von Text, Tabellen und Bounding Boxes ermöglicht. Es unterstützt die Chunking, Embedding und Indizierung in OpenSearch und Neo4j.
Warum relevant: Dieses Tool ist besonders nützlich für fortgeschrittene Dokumentanalyse und bietet eine benutzerfreundliche Web-Oberfläche. Die Kombination von RAG-Funktionalität und Selfhosting macht es zu einer starken Wahl.
docker-docling (7/10)
Repository: hwdsl2/docker-docling
Bewertung: RAG-Kern 3/3 | Dokumente 2/2 | Selfhosting 2/2 | Innovation 1/2 | Reife 0/1 = 7/10
Was es macht: Docker-Image für einen selbstgehosteten Docling-Dokumentparsingserver. Es konvertiert PDF, DOCX, PPTX, HTML und mehr in Markdown/JSON. Es unterstützt synchrone und asynchrone Konvertierung, Chunking für RAG, NVIDIA GPU-Acceleration, optionalen Web-UI, Offline-Modus und einen persistenten Modell-Cache.
Warum relevant: Dieses Projekt ist ideal für Entwickler, die eine robuste, selbstgehostete Lösung für die Dokumentverarbeitung benötigen. Die Unterstützung von verschiedenen Dokumentformaten und die GPU-Acceleration sind besonders vorteilhaft.
unified-kg-rag-on-aws (6/10)
Repository: awslabs/unified-kg-rag-on-aws
Bewertung: RAG-Kern 3/3 | Dokumente 1/2 | Selfhosting 0/2 | Innovation 1/2 | Reife 1/1 = 6/10
Was es macht: AWS-native Knowledge Graph RAG-Framework, das zwei Graph-Retrieval-Methoden — Microsoft GraphRAG und LightRAG — auf Amazon Bedrock, Neptune und OpenSearch vereint. Es unterstützt Multi-Hop QA über Dokumentkorpus, inkrementelles Indexing und mehrsprachige Unterstützung.
Warum relevant: Dieses Projekt ist besonders relevant für Unternehmen, die bereits in der AWS-Ökosystem investiert haben und erweiterte RAG-Funktionalität benötigen. Die Integration verschiedener AWS-Dienste bietet eine umfassende Lösung.
quarkus-docling (5/10)
Repository: quarkiverse/quarkus-docling
Bewertung: RAG-Kern 2/3 | Dokumente 1/2 | Selfhosting 1/2 | Innovation 1/2 | Reife 1/1 = 5/10
Was es macht: Quarkus-Docling vereinfacht die Dokumentverarbeitung und unterstützt das Parsen verschiedener Formate, einschließlich fortgeschrittener PDF-Verarbeitung. Es bietet nahtlose Integrationen in den gen-AI-Ökosystem.
Warum relevant: Dieses Projekt ist besonders nützlich für Entwickler, die mit Quarkus arbeiten und eine robuste Dokumentverarbeitung benötigen. Die Integration in den gen-AI-Ökosystem macht es zu einer interessanten Wahl.
Quelle: GitHub Search API