Claude Opus 5.5 זמין עם חלון הקשר של מיליון טוקנים ותמחור של 4 ו-20 דולר למיליון טוקני קלט ופלט. למפתחים מחכים גם שינויי תאימות שמחייבים בדיקה לפני מעבר.
Anthropic השיקה ב-22 בספטמבר את Claude Opus 5.5, הדגם הראשון במשפחת Claude 5.5. הוא מיועד בעיקר לעבודות קוד ארוכות, מחקר ומשימות ידע שבהן הסוכן נדרש להחזיק הקשר ולבצע רצף פעולות. לצד טענות לשיפור בביצועים, החברה הורידה את מחיר השימוש לעומת Opus 5.
ב-API, מיליון טוקני קלט עולים 4 דולר ומיליון טוקני פלט עולים 20 דולר. קריאה מזיכרון המטמון עולה 20 סנט למיליון טוקנים. Anthropic אומרת שעומס טיפוסי יהיה זול בכ-40 אחוז, בזכות מחיר נמוך יותר ושימוש בפחות טוקנים, ושהפלט מופק מהר יותר ביותר מ-30 אחוז. אלה מדידות של החברה ושל נסייני גישה מוקדמת, לא תוצאות מצטברות מסביבות ייצור עצמאיות.
חלון גדול, עם כללים חדשים
ל-Opus 5.5 חלון הקשר של מיליון טוקנים ופלט סינכרוני מרבי של 128 אלף טוקנים. ב-Batch API קיימת אפשרות בטא לפלט של עד 300 אלף טוקנים. adaptive thinking פעיל תמיד ואי אפשר לכבות אותו; מפתחים יכולים לשלוט בעומק החישוב באמצעות פרמטר effort.
המעבר אינו החלפת שם בלבד. בתיעוד הרשמי מפורטים ארבעה שינויי תאימות: forced tool use מחזיר שגיאה, בלוקי החשיבה קשורים לדגם ולשיחה, כלי computer use ישן אינו מתקבל בחלק מהפלטפורמות, ואי אפשר להשבית את מנגנון החשיבה. שינוי נוסף מזיז טקסט שבין קריאות לכלים לתוך בלוקי thinking. יישום שמציג למשתמש הודעות התקדמות עלול להיראות שקט עד שיוגדר ערך display מתאים.
לצוותים שמריצים סוכנים לאורך זמן יש כאן משימה ברורה לפני שדרוג: להריץ מחדש תרחישי כלי קצה, לבדוק שמירת שיחה, לעבור על זרימת אירועים ולוודא שממשק המשתמש עדיין מציג התקדמות. צריך לבדוק גם תקציבי טוקנים וזמני תגובה בפועל. מחיר מחירון נמוך אינו מבטיח חשבון נמוך יותר אם הסוכן מבצע יותר צעדים או מפעיל כלים יקרים.
הביצועים עדיין דורשים בדיקה מקומית
Anthropic פרסמה תוצאות גבוהות במבחני קוד, עבודה משרדית ושימוש במחשב, ובהשוואות אחדות הציבה את Opus 5.5 מעל דגמים קודמים שלה. TechCrunch ו-VentureBeat דיווחו על התוצאות ועל הורדת המחיר, אך רוב המספרים מגיעים מהחברה, מספקי מבחנים או מלקוחות שקיבלו גישה מוקדמת. ההגדרות שונות בין מבחן למבחן, ולעיתים גם רמת המאמץ שונה.
Anthropic מסרה שהדגם נבדק לפני ההשקה גם בידי מעריכים חיצוניים ושצורפו אליו מנגנוני ההגנה של הדגמים החזקים ביותר שלה. החברה מתארת אותו כחזק במיוחד במשימות ממושכות, אך לא פורסם עדיין בסיס רחב של תקלות ייצור, שיעורי הצלחה לפי תחום או עלות כוללת בתהליכים אמיתיים.
המשמעות המעשית היא שהשדרוג יכול להיות כדאי לצוותי פיתוח שממילא משלמים על Opus, במיוחד אם המשימות שלהם ארוכות והמטמון יעיל. ההחלטה צריכה לעבור דרך ניסוי מול מאגר קוד וסט כלים אמיתי של הארגון. שינויי ה-API הופכים בדיקת תאימות לחלק מההשקה, והם גם הסיבה שלא כדאי להעביר תעבורת ייצור רק על סמך טבלת הביצועים.
מקורות
VibeTech
כתב/ת טכנולוגיה ב-VibeTech


