הענק ל-LLM שלך גישה לנתונים שלך ללא צורך ב-fine-tuning. RAG מגשר על הפער בין מודלי שפה כלליים לידע ספציפי לתחום.

ברצונך לבנות עוזר AI שעונה על שאלות הנוגעות למסמכי הארגון שלך — חוזים, מדיניות, מאגרי ידע, תיעוד מוצר, רשומות רפואיות. ביצוע fine-tuning ל-LLM על הנתונים שלך יקר, איטי ויוצר מודל קפוא בנקודת האימון. אתה זקוק לארכיטקטורה שבה ה-LLM יכול לגשת למידע עדכני וספציפי לתחום בזמן שאילתה, לצטט את מקורותיו, ולהימנע מ'הזיות' עובדות שאינן נמצאות במסמכים שלך. RAG (Retrieval-Augmented Generation) היא הדרך להגיע לשם.
Explore more design patterns and system architectures
אדריכלים שלנו יכולים לעזור לך לעצב ולבנות מערכות תוך שימוש בדפוס זה לדרישות הספציפיות שלך.
צרו קשרRAG משפר את יצירת ה-LLM עם הקשר מאוחזר ממאגר ידע. בזמן שאילתה, המערכת ממירה את שאלת המשתמש ל-embedding, מחפשת ב-vector database אחר document chunks דומים סמנטית, וכוללת את ה-chunks הרלוונטיים ביותר כהקשר ב-LLM prompt. זה מבסס את תגובת המודל במסמכים אמיתיים, מאפשר ציטוט מקורות, ושומר על מאגר הידע ניתן לעדכון ללא אימון מחדש. RAG pipeline בסביבת ייצור מטפל בהכנסה (parsing, chunking, embedding), אחזור (vector search, reranking, hybrid search), ויצירה (prompt construction, streaming, guardrails).
לארכיטקטורה שני pipelines. ה-ingestion pipeline מעבד מסמכים באמצעות parsing (חילוץ PDF, DOCX, HTML), chunking (סמנטי או בגודל קבוע עם חפיפה), embedding (באמצעות embedding model), ואחסון (vector database + document store). ה-query pipeline מקבל שאלת משתמש, מייצר query embedding, מאחזר candidate chunks מ-vector database, מדרג אותם מחדש לפי רלוונטיות, בונה prompt עם ה-chunks המובילים כהקשר, ומזרים את תגובת ה-LLM עם ציטוטי מקורות.
text-embedding-3-large, Cohere embed-v4, או חלופות קוד פתוח (BGE, E5). עיבוד אצווה להכנסה, עיבוד שאילתה יחידה לחיפוש| שכבה | טכנולוגיות |
|---|---|
| ניתוח מסמכים (Document Parsing) | Unstructured, Apache Tika, LlamaParse, Docling, custom OCR (Tesseract, AWS Textract) |
| Embedding | OpenAI text-embedding-3-large, Cohere embed-v4, BGE-M3, E5-large-v2 |
| Vector Database | Milvus, Pinecone, Qdrant, Weaviate, pgvector (for small-scale) |
| חיפוש מילות מפתח (Keyword Search) | Elasticsearch, OpenSearch, PostgreSQL full-text search |
| Reranking | Cohere Rerank, BGE Reranker, ColBERT v2, FlashRank |
| LLM | Claude (via AI Gateway), GPT-4, Gemini — אגנוסטי לספק באמצעות AI SDK |
| אורקסטרציה (Orchestration) | LangChain, LlamaIndex, או custom pipeline (העדפה של MW לסביבת ייצור) |
| השתמש כאשר | הימנע כאשר |
|---|---|
| משתמשים זקוקים לתשובות המבוססות על מסמכים ספציפיים של הארגון שלך | מאגר הידע הוא פחות מ-50 עמודים — פשוט הכנס אותו ל-system prompt |
| מסמכים מתעדכנים לעיתים קרובות וה-AI זקוק למידע עדכני | אתה צריך שהמודל ילמד מיומנות/התנהגות חדשה, לא יגש לעובדות חדשות (בצע fine-tune במקום) |
| ציטוט מקורות ויכולת ביקורת הם דרישות (משפטי, ציות, בריאות) | השאלות הן שיחתיות בלבד ואינן דורשות ביסוס עובדתי |
| קבוצות משתמשים מרובות זקוקות לגישה לתת-קבוצות מסמכים שונות (RAG מסונן הרשאות) | אתה בונה כלי כתיבה יצירתית שבו דיוק עובדתי אינו המטרה |
MW בונה RAG pipelines מאיכות האחזור כלפי חוץ — אנו מודדים את דיוק האחזור לפני נגיעה ב-LLM prompt. מערכת RAG עם אחזור בינוני ו-LLM מעולה מייצרת תשובות שגויות שנשמעות בטוחות. ה-pipeline הסטנדרטי שלנו כולל כלי הערכת אחזור: קבוצה של שאילתות בדיקה עם מסמכים רלוונטיים ידועים, הנמדדים לפי MRR@5 ו-NDCG@10. אנו מבצעים איטרציות על chunking, embedding model ו-reranking עד שמדדי האחזור מגיעים לספי היעד לפני אופטימיזציה של יצירה. בנינו מערכות RAG לסקירת מסמכים משפטיים, מאגרי ידע בתחום הבריאות ותמיכת לקוחות רב-לשונית — והלקח המשותף הוא שאיכות האחזור מהווה 80% מאיכות התשובה.
חיפוש הטמעות קל עבור 10K וקטורים. עבור 100M וקטורים עם P99 הנמוך מ-100ms, זו בעיית תשתית — וזו הבעיה שהתבנית הזו פותרת.
MicrocosmWorks מיישמת יישוב קונפליקטים בצינורות RAG באמצעות דירוג סמכות מקור, שקילת עדכניות מבוססת חותמת זמן, וניקוד ביטחון המעריך עד כמה כל קטע מאוחזר תומך בטענתו. כאשר מאוחזרים קטעים סותרים, הצינור שלנו מציג את התשובה בעלת הסמכות הגבוהה ביותר תוך הצגה שקופה של אי ההסכמה וציטוטי המקורות, כך שמשתמשים יוכלו לקבל החלטות מושכלות. אנו בונים גם לולאות משוב שבהן מומחי תחום יכולים לסמן יישובים שגויים, מה שמשפר את דירוג האחזור לאורך זמן.
MicrocosmWorks משתמשת ב-chunking מודע-תוכן שמיישם אסטרטגיות שונות בהתבסס על מבנה המסמך – פיצול פסקאות סמנטי לפרוזה, chunking ברמת שורה או ברמת מקטע עבור טבלאות עם שימור הקשר של הכותרות, ו-chunking ברמת פונקציה עבור קוד עם הצהרות import מצורפות. אנו מעשירים כל chunk ב-metadata הכוללים כותרת מסמך, היררכיית מקטעים וסוג תוכן, כך ששלב השליפה יוכל ליישם ניקוד ספציפי לסוג. גישה זו עולה באופן עקבי בביצועיה על chunking נאיבי בגודל קבוע ב-25-40% במדדי רלוונטיות שליפה בפרויקטי הלקוחות שלנו.
MicrocosmWorks בונה מערכות הערכה הבודקות פייפליינים של RAG על פני שלושה ממדים: רלוונטיות אחזור (האם ה-'צ'אנקים' הנכונים נמצאים), נאמנות התשובה (האם התשובה שנוצרה אכן משקפת את התוכן שאוחזר), ושלמות התשובה (האם היא מתייחסת לשאלה המלאה). אנו יוצרים מערכי בדיקה 'גולדן' עם מומחי תחום הכוללים שאילתות עם תשובות ידועות, מקרי קצה עוינים, ושאלות הדורשות שילוב מידע ממספר מסמכים. הערכה זו רצה אוטומטית ב-CI/CD כך שכל שינוי בפייפליין נמדד אל מול מדדי איכות בסיסיים לפני הפריסה.
MicrocosmWorks בוחרת מאגרי וקטורים בהתבסס על קנה המידה שלכם, תבנית השאילתות ודרישות התפעול—Pinecone לפשטות מנוהלת, Weaviate לחיפוש היברידי של מילות מפתח-וקטורים, pgvector לצוותים שכבר השקיעו ב-PostgreSQL, ו-Qdrant לפריסות עצמאיות עם תפוקה גבוהה. בסקלות מתחת ל-10 מיליון וקטורים, רוב האפשרויות מספקות זמן אחזור של פחות מ-100ms, אך ההבדלים הופכים למשמעותיים במאות מיליוני וקטורים שבהם סוג האינדקס, קוונטיזציה ואסטרטגיית חלוקה חשובים במידה עצומה. אנו מבצעים בנצ'מרק לממדי ההטבעה האמיתיים שלכם ולתבניות השאילתות מול האפשרויות שנבחרו בקצרה במהלך שלב תכנון הארכיטקטורה שלנו.
MicrocosmWorks בונה צינורות הזנה מצטברים (incremental ingestion pipelines) שמנטרים מאגרי מסמכי מקור (source document repositories) לשינויים, מבצעים re-chunk ו-re-embed רק של הסעיפים שהשתנו, ומעדכנים את ה-vector store ללא צורך ב-reindex מלא. אנו מיישמים document fingerprinting שמזהה שינויים בתוכן ברמת הסעיף (section level), כך שעריכה של פסקה אחת אינה מפעילה עיבוד מחדש (reprocessing) של מסמך שלם בן 200 עמודים. עבור לקוחות עם דרישות real-time freshness, אנו מוסיפים שכבת live retrieval שמבצעת שאילתות ישירות למערכת המקור עבור מסמכים ששונו לאחרונה וממזגת את התוצאות הללו עם vector search hits.