نظام RAG للوثائق المحلية مع بحث هجين ودعم متعدد الصيغ
احتاج فريق بناء أدوات المطورين إلى نظام ذكاء وثائق محلي بالكامل يحافظ على الخصوصية ويمكنه استيعاب صيغ ملفات متعددة، وبناء قواعد معرفة قابلة للبحث، والإجابة على استفسارات اللغة الطبيعية باستخدام توليد معزز بالاسترجاع — دون إرسال أي بيانات إلى واجهات برمجة التطبيقات الخارجية.
ناقش مشروعك
التحدي
كان للحلول الحالية لنظام RAG قيود كبيرة على الحالات التي تركز على الخصوصية والمطورين:
- الاعتماد على واجهات برمجة التطبيقات الخارجية — معظم أدوات RAG تتطلب إرسال محتوى الوثائق إلى واجهات برمجة التطبيقات السحابية، مما ينتهك متطلبات الخصوصية
- دعم محدود للصيغ — الحلول عادة ما تتعامل فقط مع النص العادي أو PDF، متجاهلة جداول البيانات، وملفات Word، وHTML، وMarkdown
- تقسيم ضعيف — تقسيم النص الساذج يتجاهل هيكل الوثيقة (الصفحات، الأوراق، العناوين)، مما يخلق أجزاء فقيرة في السياق
- ثغرات الكلمات المفتاحية — البحث المعتمد على التضمين فقط يفوت المطابقات الدقيقة للكلمات المفتاحية التي يمكن أن يلتقطها البحث المعجمي
- عمى الجداول — أنظمة RAG لا يمكنها التعامل مع البيانات الجدولية المنظمة أو الإجابة على استفسارات التصفية/التجميع
- عدم وجود إعادة ترتيب — الاسترجاع في المحاولة الأولى غالبًا ما يظهر نتائج ذات صلة جزئيًا فقط دون فلتر جودة في المحاولة الثانية
حلنا
قمنا ببناء نظام RAG محلي بالكامل مع استيعاب وثائق متعددة الصيغ، وتقسيم مدرك للهيكل، وتوليد تضمين محلي، وخط أنابيب بحث هجين (دلالي + نص كامل + حداثة)، وإعادة ترتيب عبر الترميز، وواجهة مستخدم ويب — كل ذلك يعمل بالكامل على جهاز المستخدم.
الهيكلية
- محملات الوثائق: محللات خاصة بالصيغ لـ PDF، DOCX، XLSX، CSV، HTML، Markdown، والنص العادي
- المقسم: تقسيم مدرك للهيكل يحافظ على حدود الصفحات، الأوراق، والعناوين
- التضمينات: نموذج تضمين محلي عبر Transformers.js (لا توجد مكالمات لواجهات برمجة التطبيقات الخارجية)
- قاعدة بيانات المتجهات: LanceDB (بدون خادم، قائم على الملفات) لتخزين التضمينات والبحث عن التشابه
- البحث النصي الكامل: فهرسة ثلاثية القواعد للمطابقة المعجمية
- إعادة الترتيب: نموذج عبر الترميز لتسجيل النتائج المدركة للسياق
- محلل الاستعلامات: توجيه كشف النية بين الاستعلامات الدلالية والمهيكلة
- خادم الويب: Express.js API مع إدارة المشاريع ونقاط نهاية البحث
- الواجهة الأمامية: واجهة مستخدم ويب لتحميل الوثائق، الإدارة، والبحث التفاعلي
خط أنابيب معالجة الوثائق
محملات متعددة الصيغ
نمط السجل يكتشف نوع الملف تلقائيًا ويوجهه إلى المحلل المناسب:
- PDF — استخراج النص مع تقسيم على مستوى الصفحة
- Word (.docx/.doc) — تحليل مدرك للعناوين يحافظ على هيكل الوثيقة
- Excel/CSV — تحليل ورقة بورقة مع كشف الرؤوس ومحتوى على مستوى الصف
- HTML — استخراج مدرك للعلامات مع الحفاظ على الهيكل
- Markdown — تحليل الأقسام بناءً على العناوين
- Plain Text — تقسيم على أساس الخطوط
كل محمل يستخرج البيانات الوصفية (العنوان، المؤلف، تاريخ الإنشاء، عدد الصفحات/الأوراق، عدد الكلمات) إلى جانب المحتوى، مما ينتج أقسامًا منظمة مع مراجع المصدر.
التقسيم المدرك للهيكل
على عكس تقسيم النص الساذج، يحترم المقسم حدود الوثيقة:
- يحافظ على فواصل الصفحات (PDFs)، حدود الأوراق (جداول البيانات)، وتسلسل العناوين (Word/Markdown)
- تحديد الحجم بناءً على الرموز مع حجم جزء قابل للتكوين وتداخل
- تراجع هرمي: يقسم بالأقسام أولاً، ثم الفقرات، ثم الجمل
- كل جزء يحتفظ ببيانات المصدر (رقم الصفحة، اسم الورقة، العنوان) للتوثيق
التضمين والفهرسة
نموذج التضمين المحلي
- يعمل بالكامل محليًا عبر Transformers.js — لا تغادر البيانات الجهاز
- نموذج مكثف لتحسين الأداء
- تضمين دفعي لمعالجة الكميات بكفاءة
- قطع تلقائي عند حدود الكلمات مع تطبيع L2
تخزين المتجهات
يوفر LanceDB تخزين متجهات بدون خادم:
- قائم على الملفات (لا حاجة لخادم قاعدة بيانات منفصل)
- عزل لكل مشروع مع فهارس مستقلة
- مفاتيح ذاكرة تخزين مؤقتة قائمة على SHA256 لمنع التكرار
- تخزين البيانات الوصفية بجانب المتجهات للاسترجاع المصفى
خط أنابيب البحث الهجين
يجمع خط أنابيب الاسترجاع بين ثلاث إشارات ترتيب للحصول على نتائج أفضل من أي نهج فردي:
الإشارة 1: بحث التضمين (دلالي)
البحث عن التشابه المتجهي يجد الأجزاء ذات المعنى المرتبط حتى عند استخدام كلمات مختلفة. يتعامل مع إعادة الصياغة، المرادفات، والاستفسارات المفاهيمية.
الإشارة 2: البحث النصي الكامل (معجمي)
فهرسة ثلاثية القواعد مع تشابه Jaccard تلتقط المطابقات الدقيقة للكلمات المفتاحية التي قد يفوتها بحث التضمين — مهم للمصطلحات التقنية، الأسماء، والمعرفات.
الإشارة 3: تعزيز الحداثة
وزن الانحلال الأسي يفضل الوثائق التي تم الوصول إليها أو تعديلها مؤخرًا، مما يضمن ظهور المعلومات الحديثة أولاً.
دمج الدرجات
يتم دمج الإشارات بأوزان قابلة للتكوين (الافتراضي: 50% دلالي، 25% معجمي، 25% حداثة)، يتم تطبيعها، وتصفيةها بواسطة حد أدنى للدرجة.
إعادة ترتيب عبر الترميز
بعد الاسترجاع الأولي، يعيد نموذج عبر الترميز تسجيل أفضل المرشحين:
- تسجيل مدرك للسياق يأخذ في الاعتبار أزواج الاستعلام-الوثيقة معًا (وليس بشكل مستقل)
- حساب تعزيز الكلمات المفتاحية للتداخل المصطلحي
- تسجيل ممزوج (عبر الترميز + إشارات الكلمات المفتاحية)
- ينتج قائمة مرتبة نهائية بدقة أعلى من الاسترجاع في المحاولة الأولى وحده
دعم البيانات المهيكلة
بالنسبة لمحتوى جداول البيانات، يوفر النظام قدرات إضافية:
- كشف تلقائي لأنواع الأعمدة (رقمي، تاريخ، منطقي، نص)
- تصفية باللغة الطبيعية (مثل "الموظفين في الهندسة براتب أعلى من الحد")
- دعم التجميع (العد، المجموع، المتوسط، الأدنى، الأعلى)
- محلل الاستعلامات يوجه الاستعلامات المهيكلة إلى محرك مخصص بدلاً من بحث التضمين
واجهة الويب
- إدارة المشاريع — إنشاء، تحديث، وحذف مشاريع قواعد المعرفة
- تحميل الوثائق — تحميل الملفات بالسحب والإفلات مع كشف تلقائي للصيغ
- إنشاء الوثائق — إنشاء الوثائق من النص مباشرة في الواجهة
- البحث التفاعلي — واجهة استعلام باللغة الطبيعية مع نتائج مرتبة
- الإحصائيات — حجم الفهرس، عدد الوثائق، وتوزيع الصيغ لكل مشروع
الميزات الرئيسية
- محلي بالكامل — جميع المعالجة على الجهاز؛ لا مكالمات لواجهات برمجة التطبيقات الخارجية للتضمينات أو البحث
- 9 صيغ إدخال — PDF، DOCX، DOC، XLSX، XLS، CSV، HTML، Markdown، نص عادي
- تقسيم مدرك للهيكل — يحافظ على الصفحات، الأوراق، والعناوين كحدود للأجزاء
- بحث هجين — يجمع بين الإشارات الدلالية، المعجمية، والحداثة للحصول على استرجاع أفضل
- إعادة ترتيب عبر الترميز — تسجيل في المحاولة الثانية للحصول على نتائج بدقة أعلى
- استعلامات مهيكلة — تصفية وتجميع باللغة الطبيعية على بيانات جداول البيانات
- قاعدة بيانات متجهات بدون خادم — تخزين قائم على الملفات في LanceDB بدون عبء البنية التحتية
- كتابة الوثائق — قدرات التصدير لإنشاء PDF، DOCX، وXLSX
- عزل المشاريع — قواعد معرفة مستقلة مع فهارس منفصلة
- واجهة ويب — واجهة كاملة لإدارة الوثائق والبحث التفاعلي
النتائج
المكدس التقني
caseStudyDetail.more دراسات الحالة
استكشف المزيد من تطبيقاتنا التقنية
تحليل جداول البيانات والمستندات المدعوم بالذكاء الاصطناعي مع تنسيق متعدد الوكلاء والمراجع المتبادلة بين المستندات
احتاج فريق بيانات مؤسسي إلى تحليل واستعلام وتحرير مجموعات كبيرة من جداول البيانات والمستندات (Excel, CSV, Google Sheets, PDFs, Word docs) باستخدام اللغة الطبيعية — مع القدرة على الربط المرجعي للبيانات عبر ملفات متعددة وتنفيذ مهام سير عمل تحليلية متعددة الخطوات دون الحاجة إلى معالجة يدوية للبيانات.
Kickly: منصة مشاريع مدعومة بـ AI للشركات الناشئة
Kickly هي منصة لإدارة المشاريع مدعومة بـ AI ومصممة خصيصًا للشركات الناشئة — تجمع بين أتمتة المهام الذكية، والتعاون الفريقي، وتتبع التقدم في الوقت الفعلي في منتج واحد.
الأسئلة الشائعة
قامت MicrocosmWorks ببناء نظام local-first RAG حيث تعمل جميع عمليات استيعاب المستندات، وembedding generation، وvector storage، وLLM inference بالكامل على البنية التحتية الخاصة بك دون إرسال أي بيانات إلى external cloud APIs. تعتبر هذه البنية أساسية للمؤسسات التي تتعامل مع مستندات سرية، أو مواد محمية بامتياز المحامي-الموكل، أو ملكية فكرية حساسة حيث تحظر متطلبات سيادة البيانات أي معالجة سحابية، حتى مع التشفير.
نفذت MicrocosmWorks مسار استرجاع هجينًا يدير بحث BM25 بالكلمات المفتاحية والبحث الدلالي للمتجهات الكثيفة بالتوازي، ثم يستخدم reciprocal rank fusion لدمج وإعادة ترتيب النتائج المجمعة قبل تمريرها إلى LLM كسياق. يلتقط هذا النهج الاستعلامات المطابقة تمامًا مثل رموز المنتجات والاستشهادات القانونية التي يفوتها البحث الدلالي، بينما يسترجع أيضًا المحتوى المرتبط مفاهيميًا الذي لن يجده البحث بالكلمات المفتاحية أبدًا.
قامت MicrocosmWorks ببناء محللات (parsers) خاصة بالصيغ لـ PDF و DOCX و XLSX و PPTX و HTML و Markdown والنصوص العادية، مع مسار عمل (pipeline) للتعرف الضوئي على الحروف (OCR) باستخدام Tesseract لملفات PDF الممسوحة ضوئياً والمستندات المستندة إلى الصور. يكتشف النظام تلقائياً ما إذا كان ملف PDF يحتوي على نص قابل للتحديد أو يتطلب OCR، ويطبق تحليل التخطيط للحفاظ على هياكل الجداول وترتيب القراءة، ويقسم المستندات إلى أجزاء (chunks) باستخدام حدود دلالية بدلاً من حدود الأحرف التعسفية لتحسين جودة الاسترجاع.
قامت MicrocosmWorks بتطبيق الفهرسة التزايدية التي تتبع مجموعات تدقيق المستندات وتعيد معالجة الملفات التي تغيرت فقط منذ عملية الاستيعاب الأخيرة. يتم إزالة الأجزاء القديمة للمستندات المحدثة وإدراج أجزاء جديدة بشكل ذري، بحيث لا يكون فهرس البحث أبدًا في حالة غير متناسقة. يدعم النظام أيضًا استرجاع المستندات ذات الإصدارات، مما يسمح للمستخدمين بالاستعلام عن الإصدارات التاريخية للمستندات عند الحاجة لأغراض التدقيق أو الامتثال.
قامت MicrocosmWorks بتحسين الـ local RAG pipeline لتعمل على أجهزة متواضعة، مع توصية بحد أدنى لتكوين الجهاز يتضمن 32GB RAM، و 8 CPU cores، واختيارياً mid-range GPU لتسريع عملية الـ embedding generation. بالنسبة للمؤسسات التي لا تملك GPU hardware، يعود النظام إلى استخدام CPU-based embedding models مع زمن استجابة أعلى قليلاً، وتم ضبط الـ vector database لتخزين SSD للحفاظ على query response times أقل من 200ms لمجموعات البيانات (corpora) التي تصل إلى مليون document chunks.
مستعد لتحويل عملك؟
دعنا نناقش كيف يمكننا تطبيق حلول مشابهة لتحدياتك.