Aktuelle RAG-Systeme und Parser-Pipelines (GitHub)

In den letzten Monaten haben sich einige interessante RAG-Systeme und Parser-Pipelines entwickelt, die es ermöglichen, komplexe Dokumente zu verarbeiten und in wissensbasierte Anwendungen zu integrieren. Hier sind die besten Projekte, die wir gefunden haben.
flexible-graphrag (9/10)
Repository: stevereiner/flexible-graphrag
Bewertung: RAG-Kern 3/3 | Dokumente 2/2 | Selfhosting 2/2 | Innovation 2/2 | Reife 0/1 = 9/10
Was es macht: Ein umfassendes Toolkit, das verschiedene Datenquellen (darunter Alfresco und Nuxeo) unterstützt, um Wissensgraphen zu erstellen und RAG-Pipelines zu implementieren. Es bietet Optionen für automatisches Synchronisieren, Ontologien, und mehr.
Warum relevant: Das Projekt ist sehr innovativ und bietet eine breite Palette von Funktionen, die es ideal für Selfhosting und die Verarbeitung eigener Daten machen.
docling-Studio (8/10)
Repository: scub-france/docling-Studio
Bewertung: RAG-Kern 3/3 | Dokumente 2/2 | Selfhosting 2/2 | Innovation 1/2 | Reife 1/1 = 8/10
Was es macht: Ein visuelles Dokumentanalyse-Studio, das es ermöglicht, Dokumente zu extrahieren, zu chunken, zu embedden und in OpenSearch und Neo4j zu indizieren. Es unterstützt PDFs, Tabellen und OCR.
Warum relevant: Das Projekt ist gut dokumentiert und bietet eine benutzerfreundliche Oberfläche, die es ideal für Selfhosting und die Verarbeitung eigener Daten macht.
chunky (8/10)
Repository: GiovanniPasq/chunky
Bewertung: RAG-Kern 2/3 | Dokumente 2/2 | Selfhosting 2/2 | Innovation 2/2 | Reife 1/1 = 8/10
Was es macht: Ein Open-Source-Toolkit zur Verarbeitung von PDFs, Konvertierung in Markdown, Chunking, und Enrichment von Metadaten für LLM-Anwendungen. Es bietet verschiedene Chunking-Strategien und eine benutzerfreundliche Oberfläche.
Warum relevant: Das Projekt ist innovativ und bietet praktische Werkzeuge für die Verarbeitung von Dokumenten, die es ideal für Selfhosting und die Verarbeitung eigener Daten machen.
self-hosted-ai-stack (7/10)
Repository: hwdsl2/self-hosted-ai-stack
Bewertung: RAG-Kern 2/3 | Dokumente 1/2 | Selfhosting 2/2 | Innovation 1/2 | Reife 1/1 = 7/10
Was es macht: Ein vollständiger Selfhosting-Stack, der Ollama, LiteLLM, Whisper, WhisperLive, Kokoro, Embeddings, Docling und MCP Gateway umfasst. Es unterstützt NVIDIA CUDA-Acceleration und ist für mehrere Architekturen verfügbar.
Warum relevant: Das Projekt ist gut dokumentiert und bietet eine umfassende Lösung für Selfhosting, die es ideal für die Verarbeitung eigener Daten und die Integration in bestehende Infrastrukturen macht.
GustoBot (6/10)
Repository: skygazer42/GustoBot
Bewertung: RAG-Kern 2/3 | Dokumente 1/2 | Selfhosting 1/2 | Innovation 1/2 | Reife 1/1 = 6/10
Was es macht: Ein Multi-Agenten-System für Kundendienstroboter, das auf Langraph basiert und Funktionen wie txt2sql und txt2cypher unterstützt. Es bietet eine breite Palette von Anwendungen, darunter Multi-Modalität.
Warum relevant: Das Projekt ist gut dokumentiert und bietet interessante Anwendungen für die Verarbeitung von Texten und die Integration in bestehende Systeme.
Quelle: GitHub Search API