Analisis Spreadsheet & Dokumen Didukung AI dengan Orkestrasi Multi-Agen dan Referensi Lintas-Dokumen
Tim data perusahaan membutuhkan kemampuan untuk menganalisis, mengkueri, dan mengedit koleksi besar spreadsheet dan dokumen (Excel, CSV, Google Sheets, PDF, Word docs) menggunakan bahasa alami โ dengan kemampuan untuk mereferensikan data di berbagai file dan mengeksekusi alur kerja analitis multi-langkah tanpa penanganan data manual.
Diskusikan Proyek Anda
Tantangan
Bekerja dengan dokumen bisnis dalam skala besar penuh dengan hambatan:
- Data Terisolasi (Siloed Data) โ Informasi penting tersebar di puluhan spreadsheet, PDF, dan dokumen Word tanpa cara untuk melakukan kueri di seluruh dokumen tersebut
- Referensi Silang Manual (Manual Cross-Referencing) โ Membandingkan daftar harga vendor (Excel) dengan persyaratan kontrak (PDF) dengan riwayat faktur (CSV) membutuhkan waktu berjam-jam pencarian manual
- Batasan Rumus (Formula Limitations) โ Pertanyaan analitis yang kompleks tidak dapat dijawab hanya dengan rumus spreadsheet
- Batasan Jendela Konteks (Context Window Limits) โ Spreadsheet besar (50.000+ baris) melebihi batas jendela konteks LLM, membuat pendekatan naif gagal
- Tidak Ada Kemampuan Pengeditan (No Edit Capabilities) โ Alat AI yang ada hanya dapat menganalisis dokumen tetapi tidak dapat menulis perubahan kembali ke file sumber
- Penalaran Multi-Langkah (Multi-Step Reasoning) โ Pertanyaan yang membutuhkan analisis sekuensial di seluruh dokumen memerlukan alur kerja multi-langkah yang terorkestrasi
Solusi Kami
Kami membangun platform intelijen dokumen AI multi-agen dengan retrieval yang didukung database vektor untuk dokumen berukuran besar, agen khusus untuk berbagai jenis dokumen, orkestrator untuk penalaran lintas-dokumen, dan kemampuan write-back untuk pengeditan spreadsheet.
Arsitektur
- Orkestrator: Agen orkestrator AI yang mengoordinasikan alur kerja multi-langkah di seluruh agen khusus
- Agen Spreadsheet: Menangani analisis Excel/CSV/Google Sheets, pembuatan rumus, dan pengeditan sel
- Agen Dokumen: Menangani pembacaan, ekstraksi, dan ringkasan dokumen PDF/Word
- Agen Referensi Lintas-Dokumen: Melakukan penggabungan (joins), perbandingan, dan rekonsiliasi antar jenis dokumen
- Vector Database: Milvus untuk pengindeksan semantik potongan dokumen (document chunks) dan baris spreadsheet
- LLM Layer: Pendekatan multi-model dengan pemanggilan fungsi (function calling)
- Backend: Python/FastAPI untuk pemrosesan dokumen dan orkestrasi agen
- Frontend: Dasbor React dengan unggah file, antarmuka obrolan, dan pratinjau spreadsheet langsung
- Penyimpanan (Storage): S3 untuk file asli, PostgreSQL untuk metadata dan pelacakan pekerjaan
Arsitektur Multi-Agen
Peran Agen
1. Agen OrkestratorKoordinator pusat yang menerima kueri pengguna, memecahnya menjadi sub-tugas, dan mendelegasikannya kepada agen khusus. Ia menganalisis niat pengguna, membuat rencana eksekusi, mengelola aliran data antar agen, mengagregasi hasil, dan menangani pemulihan kesalahan.
2. Agen SpreadsheetKhusus untuk operasi data tabular termasuk pemahaman skema, terjemahan bahasa alami ke kueri, agregasi dan pemfilteran, pembuatan rumus, pengeditan sel dan pengisian kolom, saran bagan, serta validasi data/deteksi anomali.
3. Agen DokumenKhusus untuk dokumen tidak terstruktur dan semi-terstruktur termasuk OCR dan ekstraksi teks sadar tata letak (layout-aware), identifikasi bagian, ekstraksi nilai kunci dari kontrak, ringkasan, pencarian klausa semantik, dan ekstraksi tabel dari PDF/Word docs.
4. Agen Referensi Lintas-DokumenKhusus untuk penalaran multi-dokumen termasuk pencocokan entitas antar dokumen, rekonsiliasi data dan identifikasi perbedaan, analisis linimasa, resolusi ketergantungan untuk data yang bertentangan, dan operasi join mirip SQL di seluruh jenis dokumen.
Lapisan Database Vektor
Mengapa Vector DB untuk Dokumen
Dokumen dan spreadsheet besar tidak dapat muat dalam satu jendela konteks LLM. Database vektor memungkinkan pencarian semantik di jutaan baris dan potongan dokumen (document chunks), pengambilan hanya bagian yang relevan per kueri, penghubungan entitas lintas-dokumen melalui kesamaan embedding, dan pengindeksan persisten yang tidak memerlukan pemrosesan ulang pada setiap kueri.
Strategi Pengindeksan
Pengindeksan Spreadsheet:Setiap baris diubah menjadi representasi bahasa alami dengan menggabungkan nilai kolom kunci, lalu di-embed dan disimpan dengan referensi kembali ke file, sheet, dan indeks baris asli untuk operasi write-back.
Pengindeksan Dokumen:Dokumen diekstraksi dengan kesadaran tata letak (layout awareness), dipecah menjadi segmen semantik dengan tumpang tindih, di-embed, dan disimpan dengan referensi ke file sumber, bagian, dan nomor halaman.
Indeks Entitas Lintas-Dokumen:Indeks terpisah menghubungkan entitas (vendor, produk, orang, nomor faktur) di seluruh dokumen, memungkinkan kueri referensi silang (cross-reference queries) untuk dengan cepat menemukan semua penyebutan entitas terlepas dari file sumber.
Alur Retrieval
Ketika pengguna mengajukan pertanyaan lintas-dokumen, orkestrator mengidentifikasi dokumen dan agen mana yang dibutuhkan, melakukan pencarian vektor (vector searches) untuk menemukan data yang relevan di semua sumber, mendelegasikan ke agen khusus untuk pemrosesan, dan mengagregasi hasil menjadi respons yang koheren.
Mesin Orkestrasi
Dekomposisi Kueri
Orkestrator memecah kueri kompleks menjadi rencana eksekusi multi-langkah. Misalnya, pertanyaan seperti "Temukan vendor dengan pengiriman terlambat, periksa klausul penalti kontrak, dan hitung penalti yang dapat diklaim" akan dipecah menjadi langkah-langkah sekuensial: mengkueri data pengiriman melalui Spreadsheet Agent, mencari kontrak melalui Document Agent, dan menggabungkan hasil melalui Cross-Reference Agent.
Komunikasi Agen
- Agen berkomunikasi melalui pesan terstruktur dengan payload bertipe
- Orkestrator mempertahankan konteks eksekusi dengan hasil perantara
- Langkah yang gagal memicu strategi coba ulang atau fallback
- Hasil parsial dikembalikan jika beberapa langkah selesai tetapi yang lain gagal
Pengeditan & Write-Back Spreadsheet
Kemampuan Pengeditan
Platform ini mendukung pembaruan sel, pengisian kolom, penyisipan baris, pemformatan kondisional, pembuatan sheet baru, dan injeksi rumus โ semuanya diajukan oleh agen AI dan diterapkan dengan persetujuan pengguna.
Alur Write-Back
- Agen menentukan operasi pengeditan (sel mana, nilai apa)
- Pratinjau pengeditan ditampilkan kepada pengguna dengan penyorotan diff (nilai lama vs. baru)
- Pengguna menyetujui atau memodifikasi perubahan yang diusulkan
- Backend menerapkan perubahan pada file menggunakan library yang sesuai per format
- File yang dimodifikasi disimpan sebagai versi baru dengan jejak audit pengeditan
- Indeks vektor diperbarui untuk baris yang berubah
Kontrol Versi
- Setiap pengeditan membuat versi file baru (asli tetap dipertahankan)
- Log diff menunjukkan dengan tepat apa yang berubah, kapan, dan mengapa
- Rollback ke versi sebelumnya dengan satu klik
- Atribusi pengeditan: agen atau pengguna mana yang membuat setiap perubahan
Alur Pemrosesan untuk Dokumen Baru
Alur Unggah File
- Pengguna mengunggah file (drag-and-drop atau API)
- Jenis file terdeteksi dan diarahkan ke prosesor yang sesuai
- Spreadsheet: Diparsing, skema disimpulkan, baris di-embed dan diindeks
- PDF: OCR (jika dipindai) โ ekstraksi tata letak โ chunking โ embedding โ pengindeksan
- Dokumen Word: Ekstraksi teks โ penguraian bagian โ chunking โ embedding โ pengindeksan
- Ekstraksi Entitas: NER mengidentifikasi orang, organisasi, tanggal, jumlah di semua dokumen
- Penghubungan Lintas-Dokumen: Indeks entitas diperbarui dengan penyebutan baru
- Metadata file disimpan di PostgreSQL, embedding di database vektor, file asli di S3
Format yang Didukung
Platform ini mendukung Excel, CSV, dan Google Sheets (dengan write-back penuh), PDF asli dan hasil pindai (hanya baca), serta dokumen Word dan Google Docs (write-back terbatas).
Fitur Utama
- Arsitektur Multi-Agen โ Agen khusus untuk spreadsheet, dokumen, dan referensi silang
- Orkestrator AI โ Mendekomposisi kueri kompleks menjadi rencana eksekusi multi-langkah
- Referensi Lintas-Dokumen โ Penghubungan entitas dan rekonsiliasi data di seluruh jenis file
- Retrieval Didukung Vektor โ Pencarian semantik menangani dataset di luar batas konteks LLM
- Write-Back Spreadsheet โ AI mengedit sel, mengisi kolom, dan menyuntikkan rumus dengan persetujuan pengguna
- Dukungan Dataset Besar โ Spreadsheet berisi 50.000+ baris diindeks dan dapat dikueri melalui pencarian vektor
- Kontrol Versi โ Setiap pengeditan diberi versi dengan log diff dan kemampuan rollback
- Kueri Bahasa Alami โ Ajukan pertanyaan analitis kompleks dalam bahasa Inggris biasa
- Dukungan Multi-Format โ Excel, CSV, Google Sheets, PDF, Word, Google Docs
- Pratinjau Pengeditan โ Pratinjau yang disorot perbedaan (diff-highlighted) sebelum perubahan diterapkan
Hasil
Tumpukan Teknologi
caseStudyDetail.more Studi Kasus
Jelajahi lebih banyak implementasi teknis kami
Sistem RAG Dokumen Lokal-Pertama dengan Pencarian Hibrida & Dukungan Multi-Format
Sebuah tim yang mengembangkan alat untuk developer membutuhkan sistem kecerdasan dokumen yang sepenuhnya lokal, menjaga privasi, yang dapat menyerap berbagai format file, membangun basis pengetahuan yang dapat dicari, dan menjawab pertanyaan bahasa alami menggunakan Retrieval-Augmented Generation โ tanpa mengirim data apa pun ke API eksternal.
Kickly: Platform Proyek Berbasis AI untuk Startup
Kickly adalah platform manajemen proyek berbasis AI yang dibangun untuk startup โ menggabungkan otomatisasi tugas pintar, kolaborasi tim, dan pelacakan kemajuan real-time dalam satu produk.
Siap Mentransformasi Bisnis Anda?
Mari diskusikan bagaimana kami dapat menerapkan solusi serupa untuk tantangan Anda.