Wir haben eine Multi-Agenten-KI-Dokumentenintelligenzplattform mit vektorbasierter Datenbankabfrage für große Dokumente, spezialisierten Agenten für verschiedene Dokumenttypen, einem Orchestrator für dokumentenübergreifendes Denken und Rückschreibmöglichkeiten für die Bearbeitung von Tabellenkalkulationen entwickelt.
Architektur
- Orchestrator: KI-Orchestrator-Agent, der mehrstufige Workflows über spezialisierte Agenten koordiniert
- Tabellenkalkulationsagent: Handhabt die Analyse von Excel/CSV/Google Sheets, Formelerstellung und Zellenbearbeitung
- Dokumentenagent: Handhabt das Lesen, Extrahieren und Zusammenfassen von PDF/Word-Dokumenten
- Querverweisagent: Führt Joins, Vergleiche und Abgleiche über Dokumenttypen hinweg durch
- Vektordatenbank: Milvus für die semantische Indizierung von Dokumentenstücken und Tabellenzeilen
- LLM-Schicht: Multi-Modell-Ansatz mit Funktionsaufrufen
- Backend: Python/FastAPI für die Dokumentenverarbeitung und Agentenorchestrierung
- Frontend: React-Dashboard mit Datei-Upload, Chat-Interface und Live-Tabellenvorschau
- Speicher: S3 für Originaldateien, PostgreSQL für Metadaten und Job-Tracking
Multi-Agenten-Architektur
Agentenrollen
1. Orchestrator-Agent
Der zentrale Koordinator, der Benutzeranfragen empfängt, sie in Unteraufgaben zerlegt und an spezialisierte Agenten delegiert. Er analysiert die Benutzerabsicht, erstellt Ausführungspläne, verwaltet den Datenfluss zwischen Agenten, aggregiert Ergebnisse und kümmert sich um die Fehlerbehebung.
2. Tabellenkalkulationsagent
Spezialisiert auf tabellarische Datenoperationen, einschließlich Schemaverständnis, Übersetzung von natürlicher Sprache in Abfragen, Aggregationen und Filterung, Formelerstellung, Zellenbearbeitung und Spaltenfüllung, Diagrammvorschläge und Datenvalidierung/Anomalieerkennung.
3. Dokumentenagent
Spezialisiert auf unstrukturierte und halbstrukturierte Dokumente, einschließlich OCR und layoutbewusster Textextraktion, Abschnittsidentifikation, Schlüssel-Wert-Extraktion aus Verträgen, Zusammenfassung, semantische Klauselsuche und Tabellenauszug aus PDFs/Word-Dokumenten.
4. Querverweisagent
Spezialisiert auf dokumentenübergreifendes Denken, einschließlich Entitätsabgleich über Dokumente hinweg, Datenabgleich und Diskrepanzerkennung, Zeitachsenanalyse, Abhängigkeitsauflösung bei widersprüchlichen Daten und SQL-ähnliche Join-Operationen über Dokumenttypen hinweg.
Vektordatenbank-Schicht
Warum Vektor-DB für Dokumente
Große Dokumente und Tabellenkalkulationen passen nicht in ein einzelnes LLM-Kontextfenster. Die Vektordatenbank ermöglicht die semantische Suche über Millionen von Zeilen und Dokumentenstücken, die Abfrage nur relevanter Teile pro Anfrage, die dokumentenübergreifende Verknüpfung von Entitäten über Einbettungsähnlichkeit und eine persistente Indizierung, die bei jeder Abfrage nicht neu verarbeitet werden muss.
Indizierungsstrategie
Tabellenkalkulationsindizierung:
Jede Zeile wird in eine natürliche Sprachdarstellung umgewandelt, indem Schlüsselspaltenwerte zusammengefügt werden, dann eingebettet und mit Referenzen zur Originaldatei, dem Blatt und dem Zeilenindex für Rückschreiboperationen gespeichert.
Dokumentenindizierung:
Dokumente werden mit Layoutbewusstsein extrahiert, in semantische Segmente mit Überlappung aufgeteilt, eingebettet und mit Referenzen zur Quelldatei, dem Abschnitt und der Seitenzahl gespeichert.
Dokumentenübergreifender Entitätsindex:
Ein separater Index verknüpft Entitäten (Lieferanten, Produkte, Personen, Rechnungsnummern) über Dokumente hinweg, sodass Querverweisabfragen schnell alle Erwähnungen einer Entität unabhängig von der Quelldatei finden können.
Abrufpipeline
Wenn ein Benutzer eine dokumentenübergreifende Frage stellt, identifiziert der Orchestrator, welche Dokumente und Agenten benötigt werden, führt Vektorsuchen durch, um relevante Daten aus allen Quellen zu finden, delegiert an spezialisierte Agenten zur Verarbeitung und aggregiert die Ergebnisse zu einer kohärenten Antwort.
Orchestrierungs-Engine
Anfragezerlegung
Der Orchestrator zerlegt komplexe Anfragen in mehrstufige Ausführungspläne. Zum Beispiel würde eine Frage wie "Finde Lieferanten mit verspäteten Lieferungen, überprüfe Vertragsstrafklauseln und berechne einforderbare Strafen" in sequentielle Schritte zerlegt: Abfrage der Lieferdaten über den Tabellenkalkulationsagenten, Durchsuchen der Verträge über den Dokumentenagenten und Zusammenführen der Ergebnisse über den Querverweisagenten.
Agentenkommunikation
- Agenten kommunizieren über strukturierte Nachrichten mit typisierten Nutzlasten
- Der Orchestrator hält den Ausführungskontext mit Zwischenergebnissen aufrecht
- Fehlgeschlagene Schritte lösen Wiederholungs- oder Fallback-Strategien aus
- Teilweise Ergebnisse werden zurückgegeben, wenn einige Schritte abgeschlossen sind, andere jedoch fehlschlagen
Tabellenkalkulationsbearbeitung & Rückschreiben
Bearbeitungsfähigkeiten
Die Plattform unterstützt Zellaktualisierungen, Spaltenfüllungen, Zeileneinfügungen, bedingte Formatierung, Erstellung neuer Blätter und Formeleinspritzung — alles vorgeschlagen von KI-Agenten und mit Benutzerfreigabe angewendet.
Rückschreibpipeline
- Agent bestimmt die Bearbeitungsoperation (welche Zellen, welche Werte)
- Bearbeitungsvorschau wird dem Benutzer mit Diff-Hervorhebung gezeigt (alte vs. neue Werte)
- Benutzer genehmigt oder ändert die vorgeschlagenen Änderungen
- Backend wendet Änderungen an der Datei mit den entsprechenden Bibliotheken pro Format an
- Geänderte Datei wird als neue Version mit Bearbeitungsprotokoll gespeichert
- Vektorindex wird für geänderte Zeilen aktualisiert
Versionskontrolle
- Jede Bearbeitung erstellt eine neue Dateiversion (Original bleibt erhalten)
- Diff-Protokoll zeigt genau, was sich geändert hat, wann und warum
- Rückkehr zu jeder vorherigen Version mit einem Klick
- Bearbeitungszuordnung: welcher Agent oder Benutzer jede Änderung vorgenommen hat
Verarbeitungspipeline für neue Dokumente
Datei-Upload-Fluss
- Benutzer lädt Dateien hoch (Drag-and-Drop oder API)
- Dateityp wird erkannt und an den entsprechenden Prozessor weitergeleitet
- Tabellenkalkulationen: Geparst, Schema abgeleitet, Zeilen eingebettet und indiziert
- PDFs: OCR (wenn gescannt) → Layout-Extraktion → Chunking → Einbettung → Indizierung
- Word-Dokumente: Textextraktion → Abschnitts-Parsing → Chunking → Einbettung → Indizierung
- Entitätsextraktion: NER identifiziert Personen, Organisationen, Daten, Beträge in allen Dokumenten
- Dokumentenübergreifende Verknüpfung: Entitätsindex wird mit neuen Erwähnungen aktualisiert
- Dateimetadaten in PostgreSQL gespeichert, Einbettungen in Vektor-DB, Originale in S3
Unterstützte Formate
Die Plattform unterstützt Excel, CSV und Google Sheets (mit vollständigem Rückschreiben), native und gescannte PDFs (nur lesen) sowie Word-Dokumente und Google Docs (eingeschränktes Rückschreiben).
Hauptmerkmale
- Multi-Agenten-Architektur — Spezialisierte Agenten für Tabellenkalkulationen, Dokumente und Querverweise
- KI-Orchestrator — Zerlegt komplexe Abfragen in mehrstufige Ausführungspläne
- Dokumentenübergreifender Verweis — Entitätsverknüpfung und Datenabgleich über Dateitypen hinweg
- Vektorbasierte Abfrage — Semantische Suche bewältigt Datensätze jenseits der LLM-Kontextgrenzen
- Tabellenkalkulations-Rückschreiben — KI bearbeitet Zellen, füllt Spalten und injiziert Formeln mit Benutzerfreigabe
- Unterstützung großer Datensätze — 50.000+ Zeilen-Tabellenkalkulationen indiziert und über Vektorsuche abfragbar
- Versionskontrolle — Jede Bearbeitung wird mit Diff-Protokoll und Rückkehrmöglichkeit versioniert
- Abfragen in natürlicher Sprache — Stellen Sie komplexe analytische Fragen in einfachem Englisch
- Unterstützung mehrerer Formate — Excel, CSV, Google Sheets, PDF, Word, Google Docs
- Bearbeitungsvorschau — Diff-hervorgehobene Vorschau vor Anwendung von Änderungen