Aktuelle RAG-Systeme und Parser-Pipelines (GitHub)

# Aktuelle RAG-Systeme und Parser-Pipelines (GitHub) ![Vorschau](https://github.githubassets.com/assets/GitHub-Mark-ea2971cee799.png) In diesem Artikel stellen wir die neuesten und vielversprechends

Aktuelle RAG-Systeme und Parser-Pipelines (GitHub)

Vorschau

In diesem Artikel stellen wir die neuesten und vielversprechendsten Repositories auf GitHub vor, die sich mit Retrieval-Augmented-Generation (RAG) und Parser-Pipelines befassen. Diese Projekte bieten innovative Lösungen für die Verarbeitung und Analyse von Dokumenten, oft in Kombination mit lokalen, selbstgehosteten Systemen und maschinellem Lernen.

docling-Studio (9/10)

Repository: scub-france/docling-Studio
Bewertung: RAG-Kern 3/3 | Dokumente 2/2 | Selfhosting 2/2 | Innovation 1/2 | Reife 1/1 = 9/10
Was es macht: Ein visuelles Dokumentenanalyse-Studio, das es ermöglicht, Extraktionspipelines zu konfigurieren, Text, Tabellen und Bounding Boxes im Browser zu inspizieren und die Daten in OpenSearch und Neo4j zu chunken, zu embedden und zu indizieren.
Warum relevant: Das Projekt ist vollständig selbstgehostet und bietet eine umfassende Lösung für die Dokumentenverarbeitung und -analyse, die leicht zu erweitern ist.

flexible-graphrag (8/10)

Repository: stevereiner/flexible-graphrag
Bewertung: RAG-Kern 3/3 | Dokumente 2/2 | Selfhosting 2/2 | Innovation 1/2 | Reife 0/1 = 8/10
Was es macht: Ein flexibles Framework, das verschiedene Datenquellen, Graph-DBs und Vektor-DBs unterstützt, um RAG-Pipelines zu bauen. Es bietet Auto-Building von Knowledge Graphs, Ontologien, LLM-Integration und mehr.
Warum relevant: Die Vielfalt der unterstützten Datenquellen und die Flexibilität der Pipeline machen dieses Projekt zu einer wertvollen Ressource für fortgeschrittene RAG-Anwendungen.

chunky (8/10)

Repository: GiovanniPasq/chunky
Bewertung: RAG-Kern 3/3 | Dokumente 2/2 | Selfhosting 2/2 | Innovation 1/2 | Reife 0/1 = 8/10
Was es macht: Ein Open-Source-Toolkit für zuverlässige RAG-Pipelines, das PDFs in Markdown konvertiert, Dokumente bereinigt, Chunks inspiziert, Chunking-Strategien vergleicht und Metadaten für LLM-Anwendungen bereichert.
Warum relevant: Die Fokussierung auf die Qualität und Zuverlässigkeit der Dokumentenverarbeitung macht dieses Projekt zu einer wertvollen Ressource für Entwickler, die robuste RAG-Pipelines benötigen.

self-hosted-ai-stack (7/10)

Repository: hwdsl2/self-hosted-ai-stack
Bewertung: RAG-Kern 2/3 | Dokumente 1/2 | Selfhosting 2/2 | Innovation 1/2 | Reife 1/1 = 7/10
Was es macht: Ein vollständig selbstgehosteter AI-Stack mit Docker Compose, der Ollama, LiteLLM, Whisper, Docling und andere Tools umfasst. Es bietet lokale, private und leichte Stack-Optionen mit optionaler NVIDIA CUDA-Beschleunigung.
Warum relevant: Die Fokussierung auf Selbsthosting und lokale Datensicherheit macht dieses Projekt besonders relevant für Entwickler, die ihre Daten und Modelle lokal betreiben möchten.

unified-kg-rag-on-aws (7/10)

Repository: awslabs/unified-kg-rag-on-aws
Bewertung: RAG-Kern 3/3 | Dokumente 2/2 | Selfhosting 0/2 | Innovation 1/2 | Reife 1/1 = 7/10
Was es macht: Ein AWS-native RAG-Framework, das zwei Graph-Retrieval-Methoden (Microsoft GraphRAG und LightRAG) vereint. Es unterstützt Multi-Hop-QA, inkrementelles Indexieren und mehrere Sprachen.
Warum relevant: Die Integration mit AWS-Diensten und die Unterstützung von Multi-Hop-QA machen dieses Projekt zu einer wertvollen Ressource für Entwickler, die in der AWS-Ökosystem arbeiten.

quarkus-docling (6/10)

Repository: quarkiverse/quarkus-docling
Bewertung: RAG-Kern 2/3 | Dokumente 2/2 | Selfhosting 1/2 | Innovation 1/2 | Reife 0/1 = 6/10
Was es macht: Ein Quarkus-Extension, das die Verarbeitung und Parsen verschiedener Dokumentformate vereinfacht, einschließlich fortgeschrittener PDF-Verarbeitung, und nahtlose Integrationen mit dem gen-AI-Ökosystem bietet.
Warum relevant: Die Integration in das Quarkus-Framework und die Unterstützung vielfältiger Dokumentformate machen dieses Projekt zu einer nützlichen Ressource für Entwickler, die Java und Quarkus verwenden.


Quelle: GitHub Search API

👁 0 Aufrufe 👤 0 Leser