AI-drevet regnearks- og dokumentanalyse med multi-agent orkestrering og krydsdokumenthenvisning
Et virksomhedsdatateam havde brug for at analysere, forespørge på og redigere store samlinger af regneark og dokumenter (Excel, CSV, Google Sheets, PDF'er, Word-dokumenter) ved hjælp af naturligt sprog – med evnen til at krydshenvise data på tværs af flere filer og udføre analytiske arbejdsgange i flere trin uden manuel databehandling.
Diskuter Dit Projekt
Udfordringen
Arbejdet med forretningsdokumenter i stor skala var præget af friktion:
- Silo-data — Kritisk information var spredt ud over snesevis af regneark, PDF'er og Word-dokumenter uden mulighed for at forespørge på tværs af dem
- Manuel krydshenvisning — At sammenligne en leverandørprisliste (Excel) med kontraktvilkår (PDF) og fakturahistorik (CSV) krævede timers manuel opslag
- Formelbegrænsninger — Komplekse analytiske spørgsmål kunne ikke besvares med regnearksformler alene
- Begrænsninger i kontekstvindue — Store regneark (50.000+ rækker) overskred LLM-kontekstvinduerne, hvilket fik naive tilgange til at fejle
- Ingen redigeringsmuligheder — Eksisterende AI-værktøjer kunne analysere dokumenter, men kunne ikke skrive ændringer tilbage til kildefilerne
- Fler-trins ræsonnement — Spørgsmål, der krævede sekventiel analyse på tværs af dokumenter, krævede orkestrerede arbejdsgange i flere trin
Vores Løsning
Vi byggede en multi-agent AI-dokumentintelligensplatform med vektordatabase-understøttet genfinding til store dokumenter, specialiserede agenter til forskellige dokumenttyper, en orkestrator til krydsdokumentræsonnement og write-back-funktioner til regnearksredigering.
Arkitektur
- Orkestrator: AI-orkestreringsagent, der koordinerer arbejdsgange i flere trin på tværs af specialiserede agenter
- Regnearksagent: Håndterer Excel/CSV/Google Sheets-analyse, formelgenerering og celleredigering
- Dokumentagent: Håndterer PDF/Word-dokumentlæsning, -ekstraktion og -opsamling
- Krydshenvisningsagent: Udfører joins, sammenligninger og afstemning på tværs af dokumenttyper
- Vektordatabase: Milvus til semantisk indeksering af dokumentchunks og regnearksrækker
- LLM-lag: Multi-model tilgang med funktionskald
- Backend: Python/FastAPI til dokumentbehandling og agentorkestrering
- Frontend: React-dashboard med filupload, chatgrænseflade og live regnearksforhåndsvisning
- Lagring: S3 til originale filer, PostgreSQL til metadata og jobsporing
Multi-agent arkitektur
Agentroller
1. OrkestreringsagentDen centrale koordinator, der modtager brugerforespørgsler, dekomponerer dem til underopgaver og delegerer til specialiserede agenter. Den analyserer brugerens intention, opretter eksekveringsplaner, styrer dataflowet mellem agenter, aggregerer resultater og håndterer fejlgenoprettelse.
2. RegnearksagentSpecialiseret i tabeldataoperationer, herunder skemaforståelse, oversættelse fra naturligt sprog til forespørgsel, aggregeringer og filtrering, formelgenerering, celleredigering og kolonneudfyldning, diagramforslag og datavalidering/anomalidetektion.
3. DokumentagentSpecialiseret i ustrukturerede og semi-strukturerede dokumenter, herunder OCR og layout-aware tekstekstraktion, sektionsidentifikation, nøgleværdiekstraktion fra kontrakter, opsummering, semantisk klassesøgning og tabeludtrækning fra PDF'er/Word-dokumenter.
4. KrydshenvisningsagentSpecialiseret i ræsonnement på tværs af flere dokumenter, herunder entitetsmatchning på tværs af dokumenter, dataafstemning og uoverensstemmelsesidentifikation, tidslinjeanalyse, afhængighedsopløsning for modstridende data og SQL-lignende join-operationer på tværs af dokumenttyper.
Vektordatabaselag
Hvorfor vektordatabase til dokumenter
Store dokumenter og regneark passer ikke i et enkelt LLM-kontekstvindue. Vektordatabasen muliggør semantisk søgning på tværs af millioner af rækker og dokumentchunks, genfinding af kun relevante dele pr. forespørgsel, entitetslinking på tværs af dokumenter via embedding-lighed og persistent indeksering, der ikke kræver genbehandling ved hver forespørgsel.
Indekseringsstrategi
Regnearksindeksering:Hver række konverteres til en naturlig sprogrepræsentation ved at sammenkæde nøglekolonners værdier, hvorefter den indlejres og gemmes med referencer tilbage til den originale fil, det originale ark og rækkeindekset for write-back-operationer.
Dokumentindeksering:Dokumenter udtrækkes med layout-bevidsthed, opdeles i semantiske segmenter med overlap, indlejres og gemmes med referencer til kildefilen, sektionen og sidetallet.
Krydsdokumententitetsindeks:Et separat indeks forbinder entiteter (leverandører, produkter, personer, fakturanumre) på tværs af dokumenter, hvilket gør krydshenvisningsforespørgsler i stand til hurtigt at finde alle omtaler af en entitet uanset kildefil.
Genfindingspipeline
Når en bruger stiller et krydsdokumentspørgsmål, identificerer orkestratoren, hvilke dokumenter og agenter der er nødvendige, udfører vektorsøgninger for at finde relevante data på tværs af alle kilder, delegerer til specialiserede agenter til behandling og aggregerer resultater til et sammenhængende svar.
Orkestreringsmotor
Forespørgselsdekomponering
Orkestratoren opdeler komplekse forespørgsler i eksekveringsplaner i flere trin. For eksempel vil et spørgsmål som "Find leverandører med forsinkede leverancer, tjek kontraktens strafklausuler og beregn de erstatningsberettigede bøder" blive dekomponeret i sekventielle trin: forespørgsel på leveringsdata via regnearksagenten, søgning i kontrakter via dokumentagenten og samling af resultater via krydshenvisningsagenten.
Agentkommunikation
- Agenter kommunikerer via strukturerede beskeder med typiserede payloads
- Orkestratoren opretholder eksekveringskonteksten med mellemliggende resultater
- Mislykkede trin udløser genforsøg eller fallback-strategier
- Delvise resultater returneres, hvis nogle trin gennemføres, men andre fejler
Regnearksredigering & Write-Back
Redigeringsmuligheder
Platformen understøtter celleopdateringer, kolonneudfyldninger, rækkeindsættelse, betinget formatering, oprettelse af nye ark og formelindsprøjtning – alt sammen foreslået af AI-agenter og anvendt med brugergodkendelse.
Write-Back-pipeline
- Agenten bestemmer redigeringsoperationen (hvilke celler, hvilke værdier)
- Redigeringsforhåndsvisning vises til brugeren med diff-fremhævelse (gamle vs. nye værdier)
- Brugeren godkender eller ændrer de foreslåede ændringer
- Backend anvender ændringer på filen ved hjælp af passende biblioteker pr. format
- Den ændrede fil gemmes som en ny version med et redigeringsrevisionsspor
- Vektorindeks opdateres for ændrede rækker
Versionskontrol
- Hver redigering opretter en ny filversion (originalen bevares)
- Diff-loggen viser præcis, hvad der blev ændret, hvornår og hvorfor
- Rul tilbage til enhver tidligere version med ét klik
- Redigeringsattribuering: hvilken agent eller bruger foretog hver ændring
Behandlingspipeline for nye dokumenter
Filupload-flow
- Brugeren uploader filer (træk-og-slip eller API)
- Filtype registreres og sendes til passende processor
- Regneark: Parsed, skema udledt, rækker indlejret og indekseret
- PDF'er: OCR (hvis scannet) → layout-ekstraktion → chunking → embedding → indeksering
- Word-dokumenter: Tekstekstraktion → sektionsparsing → chunking → embedding → indeksering
- Entitetsekstraktion: NER identificerer personer, organisationer, datoer, beløb på tværs af alle dokumenter
- Krydsdokument-linking: Entitetsindeks opdateres med nye omtaler
- Filmetadata gemmes i PostgreSQL, embeddings i vektordatabase, originaler i S3
Understøttede formater
Platformen understøtter Excel, CSV og Google Sheets (med fuld write-back), native og scannede PDF'er (kun læseadgang) samt Word-dokumenter og Google Docs (begrænset write-back).
Nøglefunktioner
- Multi-agent arkitektur — Specialiserede agenter til regneark, dokumenter og krydshenvisning
- AI-orkestrator — Dekomponerer komplekse forespørgsler til eksekveringsplaner i flere trin
- Krydsdokumenthenvisning — Entitetslinking og dataafstemning på tværs af filtyper
- Vektor-drevet genfinding — Semantisk søgning håndterer datasæt ud over LLM's kontekstgrænser
- Regneark Write-Back — AI redigerer celler, udfylder kolonner og indsætter formler med brugergodkendelse
- Understøttelse af store datasæt — Regneark med 50.000+ rækker indekseret og forespørgselbart via vektorsøgning
- Versionskontrol — Hver redigering versioneres med diff-log og mulighed for rollback
- Naturlige sprogforespørgsler — Stil komplekse analytiske spørgsmål på almindeligt engelsk
- Multi-format understøttelse — Excel, CSV, Google Sheets, PDF, Word, Google Docs
- Redigeringsforhåndsvisning — Diff-fremhævet forhåndsvisning, før ændringer anvendes
Resultater
Teknologistak
caseStudyDetail.more Casestudier
Udforsk flere af vores tekniske implementeringer
Lokal-First Dokument RAG System med Hybrid Søgning & Multi-Format Support
Et team, der bygger udviklerværktøjer, havde brug for et fuldt lokalt, privatlivsbevarende dokumentintelligenssystem, der kunne indlæse flere filformater, opbygge søgbare vidensbaser og besvare naturlige sprogforespørgsler ved hjælp af Retrieval-Augmented Generation — uden at sende nogen data til eksterne API'er.
Catant HR- og personaleadministrationsplatform
Catant er en modulær HR- og personaleadministrationsplatform, der hjælper virksomheder med at administrere medarbejdere, løn, fremmøde og overholdelse af regler fra ét samlet dashboard.
Klar til at Transformere Din Virksomhed?
Lad os drøfte, hvordan vi kan anvende lignende løsninger til dine udfordringer.