Lokal-First Dokument RAG System mit Hybrid-Suche & Multi-Format-UnterstĂĽtzung
Ein Team, das Entwickler-Tools baut, benötigte ein vollständig lokales, datenschutzfreundliches Dokumenten-Intelligenzsystem, das mehrere Dateiformate einlesen, durchsuchbare Wissensdatenbanken erstellen und natürliche Sprachabfragen mit Retrieval-Augmented Generation beantworten konnte — ohne Daten an externe APIs zu senden.
Ihr Projekt besprechen
Die Herausforderung
Bestehende RAG-Lösungen hatten erhebliche Einschränkungen für datenschutzbewusste und entwicklerorientierte Anwendungsfälle:
- Abhängigkeit von externen APIs — Die meisten RAG-Tools erforderten das Senden von Dokumenteninhalten an cloudbasierte Embedding-APIs, was die Datenschutzanforderungen verletzte
- Begrenzte Formatunterstützung — Lösungen behandelten typischerweise nur einfachen Text oder PDF und ignorierten Tabellenkalkulationen, Word-Dokumente, HTML und Markdown
- Schlechtes Chunking — Naives Text-Splitting ignorierte die Dokumentenstruktur (Seiten, Blätter, Überschriften) und erzeugte kontextarme Chunks
- Keyword-Lücken — Reine embedding-basierte Suche verpasste exakte Keyword-Übereinstimmungen, die eine lexikalische Suche erfassen würde
- Tabellenkalkulationsblindheit — RAG-Systeme konnten keine strukturierten tabellarischen Daten verarbeiten oder Filter-/Aggregationsabfragen beantworten
- Kein Reranking — Die erste Abfrage lieferte oft nur teilweise relevante Ergebnisse ohne einen Qualitätsfilter im zweiten Durchgang
Unsere Lösung
Wir bauten ein vollständiges lokal-first RAG-System mit Multi-Format-Dokumentenaufnahme, struktur-bewusstem Chunking, lokaler Embedding-Erzeugung, einer hybriden Suchpipeline (semantisch + Volltext + Aktualität), Cross-Encoder-Reranking und einer webbasierten Benutzeroberfläche — alles läuft vollständig auf dem Rechner des Benutzers.
Architektur
- Dokumenten-Loader: Formatspezifische Parser fĂĽr PDF, DOCX, XLSX, CSV, HTML, Markdown und einfachen Text
- Chunker: Struktur-bewusstes Splitting, das Seiten-, Blatt- und Ăśberschriften-Grenzen bewahrt
- Embeddings: Lokales Embedding-Modell ĂĽber Transformers.js (keine externen API-Aufrufe)
- Vektordatenbank: LanceDB (serverlos, dateibasiert) für Embedding-Speicherung und Ähnlichkeitssuche
- Volltextsuche: Trigramm-basierte Indizierung fĂĽr lexikalische Ăśbereinstimmungen
- Reranker: Cross-Encoder-Modell fĂĽr kontextbewusste Ergebnisbewertung
- Abfrageanalysator: Intent-Erkennung, die zwischen semantischen und strukturierten Abfragen routet
- Webserver: Express.js API mit Projektmanagement- und Suchendpunkten
- Frontend: Webbasierte Benutzeroberfläche für Dokumenten-Upload, -Verwaltung und interaktive Suche
Dokumentenverarbeitungspipeline
Multi-Format-Loader
Ein Registry-Muster erkennt den Dateityp automatisch und leitet zum entsprechenden Parser weiter:
- PDF — Textextraktion mit seitenweiser Segmentierung
- Word (.docx/.doc) — Überschriftenbewusste Analyse, die die Dokumentenhierarchie bewahrt
- Excel/CSV — Blattweise Analyse mit Header-Erkennung und zeilenweisem Inhalt
- HTML — Tag-bewusste Extraktion mit Strukturwahrung
- Markdown — Überschriftenbasierte Abschnittsanalyse
- Einfacher Text — Zeilenbasierte Segmentierung
Jeder Loader extrahiert Metadaten (Titel, Autor, Erstellungsdatum, Seiten-/Blattanzahl, Wortanzahl) neben dem Inhalt und erzeugt strukturierte Abschnitte mit Quellenverweisen.
Struktur-bewusstes Chunking
Im Gegensatz zu naivem Text-Splitting respektiert der Chunker Dokumentengrenzen:
- Bewahrt SeitenumbrĂĽche (PDFs), Blattgrenzen (Tabellenkalkulationen) und Ăśberschriftenhierarchie (Word/Markdown)
- Token-basierte Größenbestimmung mit konfigurierbarer Chunk-Größe und Überlappung
- Hierarchischer Fallback: teilt zuerst nach Abschnitten, dann nach Absätzen, dann nach Sätzen
- Jeder Chunk behält Quellmetadaten (Seitenzahl, Blattname, Überschrift) zur Attribution
Embedding & Indizierung
Lokales Embedding-Modell
- Läuft vollständig lokal über Transformers.js — keine Daten verlassen den Rechner
- Quantisiertes Modell zur Leistungsoptimierung
- Batch-Embedding fĂĽr effiziente Massenverarbeitung
- Automatische Trunkierung an Wortgrenzen mit L2-Normalisierung
Vektorspeicherung
LanceDB bietet serverlose Vektorspeicherung:
- Dateibasiert (kein separater Datenbankserver erforderlich)
- Projektspezifische Isolation mit unabhängigen Indizes
- SHA256-basierte Cache-SchlĂĽssel zur Deduplizierung
- Metadaten werden neben Vektoren fĂĽr gefilterte Abrufe gespeichert
Hybride Suchpipeline
Die Abrufpipeline kombiniert drei Ranking-Signale fĂĽr bessere Ergebnisse als jede einzelne Methode:
Signal 1: Embedding-Suche (Semantisch)
Vektorähnlichkeitssuche findet Chunks mit verwandter Bedeutung, selbst wenn unterschiedliche Wörter verwendet werden. Handhabt Paraphrasierung, Synonyme und konzeptionelle Abfragen.
Signal 2: Volltextsuche (Lexikalisch)
Trigramm-basierte Indizierung mit Jaccard-Ähnlichkeit erfasst exakte Keyword-Übereinstimmungen, die die Embedding-Suche möglicherweise verpasst — wichtig für technische Begriffe, Namen und Bezeichner.
Signal 3: Aktualitäts-Boost
Exponentielle Abklinggewichtung bevorzugt kürzlich aufgerufene oder geänderte Dokumente, um sicherzustellen, dass aktuelle Informationen zuerst angezeigt werden.
Punktkombination
Signale werden mit konfigurierbaren Gewichten kombiniert (Standard: 50% semantisch, 25% lexikalisch, 25% Aktualität), normalisiert und durch einen Mindestpunkteschwellenwert gefiltert.
Cross-Encoder Reranking
Nach dem ersten Abruf bewertet ein Cross-Encoder-Modell die besten Kandidaten neu:
- Kontextbewusste Bewertung berücksichtigt Abfrage-Dokument-Paare zusammen (nicht unabhängig)
- Keyword-Boost-Berechnung fĂĽr TermĂĽberlappung
- Gemischte Bewertung (Cross-Encoder + Keyword-Signale)
- Erzeugt eine endgültige Rangliste mit höherer Präzision als der erste Abruf allein
UnterstĂĽtzung fĂĽr strukturierte Daten
Für Tabellenkalkulationsinhalte bietet das System zusätzliche Funktionen:
- Automatische Erkennung von Spaltentypen (numerisch, Datum, boolesch, Zeichenfolge)
- NatĂĽrliche Sprachfilterung (z.B. "Mitarbeiter in der Technik mit Gehalt ĂĽber Schwelle")
- AggregationsunterstĂĽtzung (Anzahl, Summe, Durchschnitt, Minimum, Maximum)
- Abfrageanalysator leitet strukturierte Abfragen an eine dedizierte Engine statt an die Embedding-Suche
Webschnittstelle
- Projektmanagement — Erstellen, Aktualisieren und Löschen von Wissensdatenbankprojekten
- Dokumenten-Upload — Drag-and-Drop-Datei-Upload mit automatischer Format-Erkennung
- Dokumentenerstellung — Erstellen von Dokumenten aus Text direkt in der Benutzeroberfläche
- Interaktive Suche — Natürliche Sprachabfrage-Schnittstelle mit geordneten Ergebnissen
- Statistiken — Indexgröße, Dokumentenanzahl und Formatverteilung pro Projekt
Hauptmerkmale
- Vollständig lokal — Alle Verarbeitung auf dem Gerät; keine externen API-Aufrufe für Embeddings oder Suche
- 9 Eingabeformate — PDF, DOCX, DOC, XLSX, XLS, CSV, HTML, Markdown, einfacher Text
- Struktur-bewusstes Chunking — Bewahrt Seiten, Blätter und Überschriften als Chunk-Grenzen
- Hybride Suche — Kombiniert semantische, lexikalische und Aktualitätssignale für bessere Abrufe
- Cross-Encoder Reranking — Zweitpass-Bewertung für präzisere Ergebnisse
- Strukturierte Abfragen — Natürliche Sprachfilterung und Aggregation bei Tabellenkalkulationsdaten
- Serverlose Vektor-DB — LanceDB dateibasierte Speicherung ohne Infrastruktur-Overhead
- Dokumentenschreiben — Exportmöglichkeiten für PDF-, DOCX- und XLSX-Erstellung
- Projektisolation — Unabhängige Wissensdatenbanken mit separaten Indizes
- Web-UI — Vollständige Schnittstelle für Dokumentenverwaltung und interaktive Suche
Ergebnisse
Technologie-Stack
caseStudyDetail.more Fallstudien
Entdecken Sie mehr unserer technischen Implementierungen
KI-gestĂĽtzte Tabellenkalkulations- und Dokumentenanalyse mit Multi-Agenten-Orchestrierung und DokumentenĂĽbergreifendem Verweis
Ein Unternehmensdatenteam musste große Sammlungen von Tabellenkalkulationen und Dokumenten (Excel, CSV, Google Sheets, PDFs, Word-Dokumente) mit natürlicher Sprache analysieren, abfragen und bearbeiten können — mit der Fähigkeit, Daten über mehrere Dateien hinweg zu referenzieren und mehrstufige analytische Workflows ohne manuelle Datenaufbereitung auszuführen.
Catant HR- und Workforce-Management-Plattform
Catant ist eine modulare HR- und Workforce-Management-Plattform, die Unternehmen dabei unterstĂĽtzt, Mitarbeiter, Gehaltsabrechnung, Anwesenheit und Compliance von einem einzigen Dashboard aus zu verwalten.
Bereit, Ihr Unternehmen zu transformieren?
Lassen Sie uns besprechen, wie wir ähnliche Lösungen für Ihre Herausforderungen anwenden können.