Aktuelle RAG-Systeme und Parser-Pipelines (GitHub)

In diesem Artikel stellen wir die aktuellsten und vielversprechendsten RAG-Systeme und Parser-Pipelines vor, die auf GitHub zu finden sind. Diese Projekte bieten innovative Lösungen für die Verarbeitung und Analyse von Dokumenten und die Integration in lokale und cloud-basierte Systeme.
Docling-Studio (9/10)
Repository: scub-france/docling-Studio
Bewertung: RAG-Kern 3/3 | Dokumente 2/2 | Selfhosting 2/2 | Innovation 1/2 | Reife 1/1 = 9/10
Was es macht: Docling-Studio ist ein visuelles Dokumentenanalyse-Tool, das die Extraktion von Text, Tabellen und Bounding Boxes ermöglicht. Es unterstützt die Chunking, Embedding und Indizierung von Dokumenten in OpenSearch und Neo4j.
Warum relevant: Das Projekt ist vollständig self-hostbar und bietet eine benutzerfreundliche Web-Oberfläche, die die Verarbeitung komplexer Dokumente vereinfacht. Es ist besonders für Unternehmen und Entwickler geeignet, die ihre Daten lokal verwalten möchten.
Chunky (8/10)
Repository: GiovanniPasq/chunky
Bewertung: RAG-Kern 2/3 | Dokumente 2/2 | Selfhosting 2/2 | Innovation 1/2 | Reife 1/1 = 8/10
Was es macht: Chunky ist ein Open-Source-Toolkit für zuverlässige RAG-Pipelines. Es ermöglicht die Konvertierung von PDFs in Markdown, das Reinigen von Dokumenten, das Inspectieren von Chunks und das Vergleichen von Chunking-Strategien.
Warum relevant: Chunky ist ein vielseitiges Werkzeug, das die Vorbereitung von Dokumenten für RAG-Anwendungen erleichtert. Es ist besonders nützlich für Entwickler, die ihre eigenen RAG-Pipelines aufbauen möchten.
Self-Hosted AI Stack (8/10)
Repository: hwdsl2/self-hosted-ai-stack
Bewertung: RAG-Kern 2/3 | Dokumente 1/2 | Selfhosting 2/2 | Innovation 2/2 | Reife 1/1 = 8/10
Was es macht: Dieses Projekt bietet eine vollständige, self-hostbare AI-Stack-Deployment mit Docker Compose. Es umfasst Ollama, LiteLLM, Whisper, Docling und mehr. Es ist lokal-first, privat und unterstützt NVIDIA CUDA-Beschleunigung.
Warum relevant: Die Self-Hosted AI Stack ist eine umfassende Lösung für Entwickler, die eine private und leistungsstarke AI-Umgebung aufbauen möchten. Es ist besonders für die lokale Verarbeitung von Dokumenten und Sprachanwendungen geeignet.
Unified KG RAG on AWS (7/10)
Repository: awslabs/unified-kg-rag-on-aws
Bewertung: RAG-Kern 3/3 | Dokumente 1/2 | Selfhosting 0/2 | Innovation 2/2 | Reife 1/1 = 7/10
Was es macht: Dieses AWS-native Framework vereint zwei Graph-RAG-Methodologien — Microsoft GraphRAG und LightRAG — auf Amazon Bedrock, Neptune und OpenSearch. Es unterstützt Multi-Hop-QA über Dokumentkorpusse und bietet inkrementelles Indexing und multilinguale Unterstützung.
Warum relevant: Das Projekt ist innovativ und bietet eine hochgradige Integration in AWS-Dienste. Es ist besonders für Unternehmen geeignet, die bereits in der AWS-Ökosystem investiert haben.
Quarkus Docling (6/10)
Repository: quarkiverse/quarkus-docling
Bewertung: RAG-Kern 2/3 | Dokumente 1/2 | Selfhosting 1/2 | Innovation 1/2 | Reife 1/1 = 6/10
Was es macht: Quarkus Docling vereinfacht die Verarbeitung und Parsen von Dokumenten in verschiedenen Formaten, einschließlich PDFs. Es bietet nahtlose Integrationen in den gen-AI-Ökosystem.
Warum relevant: Das Projekt ist besonders für Entwickler geeignet, die mit Quarkus arbeiten und eine robuste Dokumentenverarbeitung in ihre Anwendungen integrieren möchten.
Quelle: GitHub Search API