Skip to main content

לומדים

העמוד בתהליך תרגום. בינתיים מוצג המקור באנגלית לאחר בדיקה.

אנליטיקה מבוססת סוכנים היא לא text-to-SQL — זו הנדסת הקשר

התשובה הקצרה

המדריך של Anthropic על אנליטיקה לשירות עצמי הוא הכתיבה המעשית הברורה ביותר עד כה שמסבירה מדוע "אנליטיקה מבוססת סוכנים היא לא רק text-to-SQL".

הכותרת: Anthropic מייעלת בערך 95% משאילתות האנליטיקה העסקיות שלה עם Claude בדיוק אגרגטיבי של כ-95%. אבל החלק החשוב הוא איך — ובכמעט אף אחד מהמקרים זה לא קשור ל-SQL. הנתונים של Anthropic מראים ש־Claude קיבל לא יותר מ-21% בבחינות האנליטיקה שלהם ללא מיומנויות, ועמד על 95%+, עד כ־99% בכמה תחומים, כשהן מופעלות. הקפיצה נבעה מהנחיה פרוצדורלית, לא משיפור ביצירת SQL.

למה text-to-SQL הוא המסגרת השגויה

text-to-SQL הוא החלק שאפשר להדגים ב-30 שניות: שואלים באנגלית, רואים שאילתה, מקבלים מספר. זה מרגיש קסום. זה גם יוצר תחושת דיוק כוזבת, כי שום דבר מזה לא מוכיח שהשאלה העסקית נענתה כראוי.

קחו את "מה היה ההכנסה מפעילות לקוחות בחודש שעבר?" ה-SQL הוא החלק הקל. החלק הקשה הוא להחליט: מה נחשב פעיל? איזו הגדרת לקוח היא הרשמית? ברוטו או נטו? איזה שדה תאריכים? אילו סינוני החזרות וזיופים חלים? המודל כותב SQL אחרי שכל הבחירות האלה נעשו.

לכן המסגרת של Anthropic — "נתונים אינם תוכנה" — היא התזה. לתוכנה יש בדיקות והוכחות דטרמיניסטיות. באנליטיקה יש תשובה נכונה אחת ממקור אמת אחד, ואין דרך דטרמיניסטית להוכיח נכונות רק מתוך תוצר הפלט. הסוכן יכול לכתוב SQL מושלם ועדיין לטעות במשמעות.

שלושת מצבי הכישלון

Anthropic מייחסת את רוב השגיאות לשלוש סיבות:

  • עמימות מושגית/יישותית — "משתמשים פעילים" או "הכנסות" מתורגמות למספר מימושים סבירים, והמימוש השגוי עדיין נראה מקצועי.
  • התיישנות נתונים — סכימות, הגדרות עסקיות ומסמכים משתנים; הפרוצדורה הנכונה אתמול הופכת לשגויה בשקט.
  • כישלון אחזור — התשובה הנכונה קיימת אך מרחב החיפוש גדול כל כך שהסוכן מפספס אותה ובטוח בלא נכון שבנה על בסיס פגם קרוב.

המחסן לבדו לא פותר את זה. מחסנים מאחסנים נתונים; הם לא מאחסנים את המשמעות של העסק.

הערימה בעלת ארבע שכבות

הפתרון של Anthropic הוא ערימה שבה ה-SQL נמצא בהמשך כל ההחלטות הקשות:

  1. בסיסי נתונים — מערכי נתונים קנוניים, מקור אמת יחיד, מודל ממדים, בדיקות רעננות, מטא־דאטה שמתייחסת כמוצר מדרגה ראשונה. פחות מועמדים סבירים עוד לפני שהחיפוש מתחיל.
  2. מקורות אמת — השכבה הסמנטית, שרשרת המוצא (lineage), מאגר שאילתות והקשר עסקי. הסוכנים נדרשים מבנית להתייעץ עם השכבה הסמנטית ראשית; SQL גולמי הוא פתרון גיבוי.
  3. מיומנויות — ידע פרוצדורלי: מאיזה מקור להתחיל, מתי לחזור אחורה, מה להבהיר, איך לבצע סקירה אדברסריאלית. כאן נובעת הקפיצה בדיוק.
  4. אימות — בחינות בלתי-מקוונות (offline), ריצות אבלציה, סקירות אדברסריאליות, כותרות פרובננס, ולולאות תחזוקה.

שתי ממצאים לא אינטואיטיביים בולטים:

  • אל תתנו ל-LLM לבנות את השכבה הסמנטית. Anthropic ניסו לייצר אוטומטית הגדרות מטריקות מטבלאות גולמיות. זה ייצר הגדרות שנראו סבירות אך קידדו את אותן עמימות שהם ניסו להסיר, והיה שלילי בסך הכל בהשוואה לשכבה קטנה יותר שנערכה בידי אדם. תייצרו תיעוד עם Claude, אבל תנו לאדם להיות הבעלים של ההגדרות.
  • היסטוריית שאילתות גולמית עוזרת במעט. מתן גישה ישירה לאלפי שאילתות SQL ישנות הזיז את הדיוק פחות מנקודה. 80% מהזמן התשובה הייתה בקורפוס — הסוכן אפילו קרא אותה — אך עדיין לא השתמש בה. צוואר הבקבוק הוא מבנה, לא גישה.

לקח התחזוקה

האזהרה המעשית ביותר: מיומנויות מתיישנות. מסמכי מיומנויות מתארים מודל נתונים שמשתנה מדי יום. Anthropic ראתה את הדיוק מחוץ‑קוו מתנדנד מ‑~95% ל־~65% בתוך חודש לפני שטיפלו בתחזוקה כבעיה הנדסית.

התיקון שלהם היה משעמם ויעיל: לשים את קבצי המיומנויות בפועל באותו מאגר קוד כמו דגמי הנתונים, כך ש‑PR שמשנה מודל גם יעדכן את המסמכים שלו. תוסף לבדיקת קוד מסמן כל שינוי במודל דיווח שלא נוגע לקובץ מיומנות. עכשיו בערך 90% מ‑PR־י דגם הנתונים שלהם כוללים שינוי במיומנות באותו דיפ.

להתחיל (אל תבנו קתדרלה)

העצה של Anthropic: כמה מערכי נתונים קנוניים, כמה עשרות בחינות בלתי‑מקוונות, ומיומנות דקה אחת תופסים את רוב הערך. כל השאר הוסף רק אחרי שזה קיים.

רצף התחלתי מעשי:

  1. בחרו תחום אחד, לא כל מחסן הנתונים.
  2. צרו מקור אמת מונחה — מערכי נתונים קנוניים, הגדרות מטריקות מפורשות, בעלות, בדיקות רעננות — לפני שנוגעים בפרומפטים.
  3. תנו עדיפות לשכבה הסמנטית, עשו את ה‑SQL הגולמי כגיבוי.
  4. כתבו מיומנות/מדריך דק שמקודד את פרוצדורת האנליסט: להבהיר, לבחור מקור, לאמת, לדווח, לציין מוצא.
  5. בנו סט מבחנים קטן — 20–30 שאלות אמיתיות עם תשובות צפויות עדיף על מאה הדגמות פנימיות.

מסקנה

מלכודת "תחושת הדיוק הכוזבת" שאותה Anthropic מזהירים ממנה חלה גם על הסביבה שלכם: לחבר מודל שיחורי frontier ישירות למסד נתונים ולקרוא לזה אנליטיקה זו הדרך להסתיים עם מספרים בטוחים אך שגויים. ההרגל העמיד לשאול ממנו הוא ה‑provenance footer — כל תשובה אנליטית צריכה לציין את דרגת המקור שלה (שכבה סמנטית › מקור מובנה › טבלה גולמית), רעננות ובעלים. אם אינכם יכולים להפיק את הכותרת הזו, גם הסוכן שלכם לא יכול — וזה הסיגנל שחסרה שכבת ההקשר.


מקור ראשי: How Anthropic enables self-service data analytics with Claude (Anthropic, 3 ביוני 2026). עובדות (95%/~99%, 21%, שלושת מצבי הכשל, שקיעה 95%→65%) אומתו מול פוסט המקור של Anthropic בתאריך 2026-08-07.