AI Destekli E-Tablo ve Belge Analizi, Çoklu Ajan Orkestrasyonu ve Belgeler Arası Referans ile
Bir kurumsal veri ekibi, çok sayıda e-tablo ve belge (Excel, CSV, Google Sheets, PDF'ler, Word belgeleri) koleksiyonunu doğal dil kullanarak analiz etme, sorgulama ve düzenleme ihtiyacı duyuyordu. Bu işlem, birden fazla dosya arasında veri çapraz referanslama ve manuel veri düzenleme gerektirmeden çok adımlı analitik iş akışlarını yürütme yeteneğiyle birlikte olmalıydı.
Projenizi Tartışın
Zorluk
İş belgeleriyle büyük ölçekte çalışmak, aşağıdaki sürtünmeleri barındırıyordu:
- Silolanmış Veri — Kritik bilgiler, düzinelerce e-tablo, PDF ve Word belgesine dağılmış durumdaydı ve bunlar arasında sorgulama yapmanın bir yolu yoktu
- Manuel Çapraz Referanslama — Bir satıcı fiyat listesini (Excel) sözleşme koşulları (PDF) ve fatura geçmişi (CSV) ile karşılaştırmak saatler süren manuel aramalar gerektiriyordu
- Formül Sınırlamaları — Karmaşık analitik sorular, yalnızca e-tablo formülleriyle yanıtlanamıyordu
- Bağlam Penceresi Sınırlamaları — Büyük e-tablolar (50.000+ satır), LLM bağlam pencerelerini aşıyor ve basit yaklaşımların başarısız olmasına neden oluyordu
- Düzenleme Yeteneği Yoktu — Mevcut AI araçları belgeleri analiz edebiliyor ancak değişiklikleri kaynak dosyalara geri yazamıyordu
- Çok Adımlı Akıl Yürütme — Belgeler arasında sıralı analiz gerektiren sorular, orkestrasyonlu çok adımlı iş akışlarına ihtiyaç duyuyordu
Çözümümüz
Büyük belgeler için vektör veritabanı destekli alma (retrieval), farklı belge türleri için uzmanlaşmış ajanlar, belgeler arası akıl yürütme için bir orkestratör ve e-tablo düzenleme için geri yazma (write-back) yeteneklerine sahip çok ajanlı bir AI belge zekası platformu oluşturduk.
Mimari
- Orkestratör: Uzmanlaşmış ajanlar arasında çok adımlı iş akışlarını koordine eden AI orkestratör ajanı
- E-Tablo Ajanı: Excel/CSV/Google Sheets analizini, formül oluşturmayı ve hücre düzenlemelerini yönetir
- Belge Ajanı: PDF/Word belgesi okuma, çıkarma ve özetleme işlemlerini yönetir
- Çapraz Referans Ajanı: Belge türleri arasında birleştirmeler, karşılaştırmalar ve mutabakat yapar
- Vektör Veritabanı: Belge öbeklerinin ve e-tablo satırlarının anlamsal indekslenmesi için Milvus
- LLM Katmanı: Fonksiyon çağrısı ile çok modelli yaklaşım
- Backend: Belge işleme ve ajan orkestrasyonu için Python/FastAPI
- Frontend: Dosya yükleme, sohbet arayüzü ve canlı e-tablo önizlemesi içeren React panosu
- Depolama: Orijinal dosyalar için S3, meta veri ve iş takibi için PostgreSQL
Çok Ajanlı Mimari
Ajan Rolleri
1. Orkestratör AjanıKullanıcı sorgularını alan, bunları alt görevlere ayıran ve uzmanlaşmış ajanlara devreden merkezi koordinatördür. Kullanıcı niyetini analiz eder, yürütme planları oluşturur, ajanlar arası veri akışını yönetir, sonuçları toplar ve hata kurtarma işlemlerini yapar.
2. E-Tablo AjanıŞema anlama, doğal dilden sorguya çeviri, toplama ve filtreleme, formül oluşturma, hücre düzenleme ve sütun doldurma, grafik önerileri ve veri doğrulama/anomali tespiti gibi tablo veri işlemleri konusunda uzmanlaşmıştır.
3. Belge AjanıOCR ve düzen duyarlı metin çıkarma, bölüm tanımlama, sözleşmelerden anahtar-değer çıkarma, özetleme, anlamsal madde arama ve PDF/Word belgelerinden tablo çıkarma gibi yapılandırılmamış ve yarı yapılandırılmış belgeler konusunda uzmanlaşmıştır.
4. Çapraz Referans AjanıBelgeler arası varlık eşleştirme, veri mutabakatı ve tutarsızlık tespiti, zaman çizelgesi analizi, çakışan veriler için bağımlılık çözünürlüğü ve belge türleri arasında SQL benzeri birleştirme işlemleri dahil olmak üzere çoklu belge akıl yürütme konusunda uzmanlaşmıştır.
Vektör Veritabanı Katmanı
Belgeler İçin Neden Vektör Veritabanı?
Büyük belgeler ve e-tablolar tek bir LLM bağlam penceresine sığmaz. Vektör veritabanı, milyonlarca satır ve belge öbeği arasında anlamsal arama, sorgu başına yalnızca ilgili kısımların alınması, gömme (embedding) benzerliği aracılığıyla belgeler arası varlık bağlantısı ve her sorguda yeniden işleme gerektirmeyen kalıcı indeksleme imkanı sunar.
İndeksleme Stratejisi
E-Tablo İndeksleme:Her satır, anahtar sütun değerleri birleştirilerek doğal dil temsiline dönüştürülür, ardından gömülür (embedded) ve geri yazma (write-back) işlemleri için orijinal dosyaya, sayfaya ve satır indeksine referanslarla birlikte depolanır.
Belge İndeksleme:Belgeler düzen duyarlılığıyla çıkarılır, örtüşen anlamsal segmentlere ayrılır (chunked), gömülür (embedded) ve kaynak dosyaya, bölüme ve sayfa numarasına referanslarla birlikte depolanır.
Belgeler Arası Varlık İndeksi:Ayrı bir indeks, belgeler arasında varlıkları (satıcılar, ürünler, kişiler, fatura numaraları) birbirine bağlar ve çapraz referans sorgularının, kaynak dosyadan bağımsız olarak bir varlığın tüm bahsedildiği yerleri hızla bulmasını sağlar.
Alma (Retrieval) Hattı
Bir kullanıcı belgeler arası bir soru sorduğunda, orkestratör hangi belgelerin ve ajanların gerekli olduğunu belirler, tüm kaynaklar arasında ilgili verileri bulmak için vektör aramaları yapar, işleme için uzmanlaşmış ajanlara yetki verir ve sonuçları tutarlı bir yanıt halinde toplar.
Orkestrasyon Motoru
Sorgu Ayrıştırma
Orkestratör, karmaşık sorguları çok adımlı yürütme planlarına böler. Örneğin, "Geç teslimat yapan satıcıları bulun, sözleşme ceza maddelerini kontrol edin ve talep edilebilir cezaları hesaplayın" gibi bir soru, sıralı adımlara ayrılır: E-Tablo Ajanı aracılığıyla teslimat verilerini sorgulama, Belge Ajanı aracılığıyla sözleşmeleri arama ve Çapraz Referans Ajanı aracılığıyla sonuçları birleştirme.
Ajan İletişimi
- Ajanlar, tip tanımlı (typed) yüklerle yapılandırılmış mesajlar aracılığıyla iletişim kurar
- Orkestratör, ara sonuçlarla yürütme bağlamını korur
- Başarısız adımlar, yeniden deneme veya geri dönüş (fallback) stratejilerini tetikler
- Bazı adımlar tamamlanıp diğerleri başarısız olursa kısmi sonuçlar döndürülür
E-Tablo Düzenleme ve Geri Yazma (Write-Back)
Düzenleme Yetenekleri
Platform, hücre güncellemelerini, sütun doldurmaları, satır eklemeyi, koşullu biçimlendirmeyi, yeni sayfa oluşturmayı ve formül eklemeyi destekler; bunların hepsi AI ajanları tarafından önerilir ve kullanıcı onayıyla uygulanır.
Geri Yazma (Write-Back) Hattı
- Ajan, düzenleme işlemini (hangi hücreler, hangi değerler) belirler
- Fark vurgulamasıyla (eski ve yeni değerler) kullanıcıya düzenleme önizlemesi gösterilir
- Kullanıcı, önerilen değişiklikleri onaylar veya değiştirir
- Backend, formata uygun kütüphaneleri kullanarak dosyaya değişiklikleri uygular
- Değiştirilen dosya, düzenleme denetim izi ile yeni bir sürüm olarak kaydedilir
- Değişen satırlar için vektör indeksi güncellenir
Sürüm Kontrolü
- Her düzenleme, yeni bir dosya sürümü oluşturur (orijinal korunur)
- Fark günlüğü, neyin, ne zaman ve neden değiştiğini tam olarak gösterir
- Tek tıklamayla herhangi bir önceki sürüme geri dönme
- Düzenleme atfı: her değişikliği hangi ajanın veya kullanıcının yaptığı
Yeni Belgeler İçin İşleme Hattı
Dosya Yükleme Akışı
- Kullanıcı dosyaları yükler (sürükle-bırak veya API)
- Dosya türü algılanır ve uygun işlemciye yönlendirilir
- E-Tablolar: Ayrıştırılır, şeması çıkarılır, satırlar gömülür (embedded) ve indekslenir
- PDF'ler: OCR (taranmışsa) → düzen çıkarma → öbekleme (chunking) → gömme (embedding) → indeksleme
- Word Belgeleri: Metin çıkarma → bölüm ayrıştırma → öbekleme (chunking) → gömme (embedding) → indeksleme
- Varlık Çıkarma: NER, tüm belgelerde kişileri, kuruluşları, tarihleri, miktarları tanımlar
- Belgeler Arası Bağlantı: Yeni bahsedilenlerle varlık indeksi güncellenir
- Dosya meta verileri PostgreSQL'de, gömmeler (embeddings) vektör veritabanında, orijinaller S3'te depolanır
Desteklenen Formatlar
Platform, Excel, CSV ve Google Sheets'i (tam geri yazma ile), yerel ve taranmış PDF'leri (salt okunur) ve Word belgeleri ile Google Docs'u (sınırlı geri yazma ile) destekler.
Temel Özellikler
- Çok Ajanlı Mimari — E-tablolar, belgeler ve çapraz referanslama için uzmanlaşmış ajanlar
- AI Orkestratör — Karmaşık sorguları çok adımlı yürütme planlarına ayrıştırır
- Belgeler Arası Referans — Dosya türleri arasında varlık bağlantısı ve veri mutabakatı
- Vektör Destekli Alma (Retrieval) — Anlamsal arama, LLM bağlam sınırlarının ötesindeki veri kümelerini işler
- E-Tablo Geri Yazma (Write-Back) — AI, kullanıcı onayıyla hücreleri düzenler, sütunları doldurur ve formülleri ekler
- Büyük Veri Seti Desteği — 50.000+ satırlık e-tablolar indekslenir ve vektör aramasıyla sorgulanabilir
- Sürüm Kontrolü — Her düzenleme, fark günlüğü ve geri alma yeteneği ile sürümlenir
- Doğal Dil Sorguları — Karmaşık analitik soruları sade İngilizce ile sorun
- Çoklu Format Desteği — Excel, CSV, Google Sheets, PDF, Word, Google Docs
- Düzenleme Önizlemesi — Herhangi bir değişiklik uygulanmadan önce fark vurgulamalı önizleme
Sonuçlar
Teknoloji Yığını
caseStudyDetail.more Vaka Çalışmaları
Daha fazla teknik uygulamamızı keşfedin
Hibrit Arama ve Çok Biçimli Destekli Yerel-Önce Belge RAG Sistemi
Geliştirici araçları geliştiren bir ekip, birden çok dosya formatını işleyebilen, aranabilir bilgi tabanları oluşturabilen ve Retrieval-Augmented Generation kullanarak doğal dil sorgularını yanıtlayabilen, tamamen yerel, gizliliği koruyan bir belge zekası sistemine ihtiyaç duyuyordu — harici API'lere hiçbir veri göndermeden.
Catant HR ve İş Gücü Yönetim Platformu
Catant, işletmelerin çalışanları, bordroyu, katılımı ve uyumluluğu tek bir kontrol panelinden yönetmelerine yardımcı olan modüler bir HR ve iş gücü yönetim platformudur.
İşletmenizi Dönüştürmeye Hazır mısınız?
Zorluklarınıza benzer çözümler uygulamamızın yollarını konuşalım.