Sonnet 5 vs Sonnet 4.6: read the benchmark, not the backlash
התשובה הקצרה
"הכותרת 'Sonnet 5 טובה רק בלנצח את Sonnet 4.6' חדה, אבל היא מטשטשת את השאלה המועילה: איזה מודל טוב יותר לעומס העבודה שלכם, בהגדרות שלכם, בעלות ובשהייה בזמן מקובלים?"
Anthropic מתארת את Sonnet 5 כהגרסה הכי בעלת יכולות סוכניות (agentic) של Sonnet, עם שיפורים בקידוד, שימוש בכלים, תכנון ועבודה מקצועית. כרטיס המערכת הרשמי שלה עדיף לפרטים מהסיכום בהשקה. Sonnet 5 משפר רבות מההערכות הראשיות, אך כמה תוצאות ממוקדות נמוכות יותר מאשר Sonnet 4.6. זה נורמלי לדגם חדש וסיבה להערכה מעשית, לא הוכחה לכך שהשיווק או הביקורת של הקהילה צודקים באופן מוחלט.
מה שעומד בתמיכה בעדויות הרשמיות
ההכרזה על Sonnet 5 מציינת שהמודל מביא יכולות שבעבר דרשו דגמים גדולים יותר לתחום Sonnet. הוא הושק בכל מוצרי Claude וב־API עם חלון הקשר טבעי של מיליון טוקנים.
כרטיס המערכת מתעד את תנאי ההערכה בפועל וחושף תוצאות מעורבות. לדוגמה, במשימה של תכנון רצפי־ביולוגיה אחד, הציון של Sonnet 5 בעיצוב הרצף הטוב ביותר היה נמוך יותר מזה של Sonnet 4.6, בעוד שהתוצאה החזויות (prediction) שלו הייתה מעט טובה יותר. הערכות אחרות השתמשו בהגדרות מאמץ שונות, כלים, מבני תמיכה, תקציבי טוקנים ומספר ניסיונות משתנה.
הקשר הזה אינו אותיות קטנות. מודל יכול להוביל בבנצ'מרק קידוד ועדיין להרגיש פחות טוב בריפוזיטורי מסוים כי הוא מבצע עריכות אגרסיביות מדי, לא עוקב בקביעות אחרי קונבנציות מקומיות, או מבזבז יותר זמן בהסקת מסקנות. הוא גם יכול להפסיד בבנצ'מרק מדעי צר בעודו טוב משמעותית בעבודה תוכנתית רב‑שלבית.
למה תרשימי ההשקה והביקורת גם יחד מטעות
חומר ההשקה בוחר הערכות שמבהירות את חוזקות המודל המתוכננות. דיווחי קהילה בוחרים באי־הצלחות זכורות. שניהם שימושיים, אבל אף אחד מהם אינו החלטה רמת־עומס עבודה.
שימו לב לארבע שגיאות השוואה נפוצות:
- מנגנוני מבחן שונים — גישה לכלים, פרומפטים, דחיסת פלט ומדיניות ניסיונות חוזרים יכולים לשנות במידה ניכרת ציוני יכולות סוכניות.
- הרצות יחידות — דגמים לא־דטרמיניסטיים דורשים ניסויים חוזרים; הצלחה או כישלון יחיד הם אנקדוטה.
- ברירות מחדל שונות — רמת מאמץ, התנהגות חשיבה וסקלפולדינג של Claude Code עשויים להשתנות בין גרסאות.
- החלפת בנצ'מרק — תוצאת בנצ'מרק SWE (SWE‑bench) איננה מודדת את סגנון ה־frontend שלכם, את צינור הנתונים או את דיוק סקירת הקוד.
אפילו זכייה תקפה בממוצע יכולה להסתיר ירידות במשימה צרה. לעומת זאת, כמה פוסטים כועסים יכולים לנבוע מהפתעות במיגרציה ולא מירידה רחבה ביכולות.
מבחן מעבר מעשי
בנו סט הערכה קטן מתוך עבודה שאתם כבר מבינים. חמש עד עשרים משימות מספיקות כדי לחשוף הבדלים כיווניים:
- כללו תיקון באג, פיצ'ר בקנה מידה מוגדר, רפקטור, משימת כתיבת בדיקות ומשימת סקירת קוד.
- התחילו כל מודל מאותו commit ואותן הוראות.
- התאימו רמות מאמץ והרשאות כלים ככל שמוצרי ההרצה מאפשרים.
- הריצו משימות חשובות יותר מפעם אחת.
- דרגו נכונות תחילה, ואז שינויים מיותרים, איכות הבדיקות, ציות להוראות, אחידות וביצועים/עלות.
השאירו את התוצאה הצפויה מחוץ לפרומפט כדי שהמודל לא יוכל פשוט לשקף את הקריטריון. בדקו את ה‑patch, הריצו את אותם בדיקות אוטומטיות, ותעדו האם היה צורך בהתערבות ידנית.
מתי להישאר על Sonnet 4.6
השארו על Sonnet 4.6 כאשר הוא כבר אמין בעבודה יציבה בפרודקשן ו־Sonnet 5 לא הראה שיפור מספק להצדיק סיכון מיגרציה. מודל מוכר עם מצבי כשל מדודים יכול להיות בעל ערך רב יותר מציון בנצ'מרק ממוצע גבוה יותר.
עברו ל‑Sonnet 5 כאשר ההשוואה הזוגית שלכם מראה שיעור השלמה טוב יותר, פחות סבבי תיקון או תפוקה מותאמת עלות טובה יותר בעבודה שחשובה לכם. לעומסי עבודה מעורבים, ניתוב הוא תשובה תקפה: השאירו את המודל הישן למשימה שבה הוא מוביל והשתמשו ב‑Sonnet 5 בעבודות קידוד סוכניות שבהן השיפורים שלו באים לידי ביטוי.
מסקנה
Sonnet 5 לא חייב לנצח בכל בנצ'מרק כדי להיות שדרוג שכדאי לבצע, וסרטון השקה לא עושה אותו הבחירה הטובה לכל משימה. התייחסו גם להכרזה וגם לביקורת כהיפותזות. ההחלטה שייכת להערכה שלכם — חוזרת וגרסאות מבוקרות.
הטענות נבדקו מול ההודעה של Anthropic (Sonnet 5 announcement), דף המודל (Sonnet model page) וכרטיס המערכת של Claude Sonnet 5 (Claude Sonnet 5 system card).