Meta פתחה את Muse Spark 1.3 ב־Muse Code וב־Meta Model API. החברה מדווחת על שיפור בעבודות קוד ארוכות ועל פחות קריאות לכלים, אבל מצב max reasoning עדיין ממתין לבדיקות בטיחות.
Meta שחררה ב־2 בספטמבר את Muse Spark 1.3 והחלה להפיץ אותו ב־Muse Code וב־Meta Model API. זו גרסה שמכוונת בעיקר לעבודת קוד ולמשימות סוכנים ארוכות, שבהן המודל צריך לאסוף הקשר, להשתמש בכלים ולהחזיק כמה מהלכים במקביל. מצב max reasoning אינו חלק מההשקה המיידית; Meta אומרת שהוא ייפתח אחרי השלמת בדיקות בטיחות נוספות.
מה השתנה בגרסה 1.3
לפי מסמך ההשקה של Meta, המודל אומן לנהל משימות ארוכות בתוך שיחה אחת, לשמור דרישות גם כשהמשתמש משנה כיוון, ולבקש הבהרה כאשר ההנחיה עמומה. החברה מתארת גם התנהגות זהירה יותר לפני פעולות שקשה לבטל. אלה טענות של היצרנית, והן חשובות במיוחד במערכות שמחברות מודל לכלי פיתוח, מסמכים ושירותים חיצוניים.
בצד הקוד, Meta מדווחת שבהשוואות פנימיות ל־Muse Spark 1.2 הגרסה החדשה השתמשה בכ־20% פחות קריאות לכלים ובכ־25% פחות טוקנים. הנתונים עשויים להצביע על עלות נמוכה יותר למשימה ועל פחות צעדים מיותרים, אך הם עדיין לא אומתו באופן עצמאי. גם ציוני ההערכה שמופיעים בדוח של Meta נמדדו בתנאים שבחרה החברה, ולכן צוותים צריכים לבחון את המודל על מאגרי קוד ותהליכים משלהם.
מה זה אומר למפתחים
למשתמשי Muse Code השינוי אמור להיות זמין דרך המוצר הקיים. לקוחות API יכולים לבדוק את 1.3 כמודל חדש בלי להמתין למצב החשיבה המרבי. כדאי להתחיל בהרצה מקבילה מול 1.2 על משימות מייצגות: תיקון באג שנוגע בכמה קבצים, מעבר על תיעוד סותר, והפעלה של כלי בדיקה עם הרשאות מוגבלות. המדדים השימושיים כאן הם זמן עד תוצאה, מספר קריאות לכלים, שיעור תיקונים חוזרים ועלות כוללת למשימה.
כדאי למדוד גם את מה שקורה כשהעבודה נקטעת באמצע: האם המודל זוכר החלטות קודמות, משייך הודעה חדשה למשימה הנכונה ומזהה שחסר לו קובץ או אישור. במשימות ארוכות, אובדן הקשר או פעולה על היעד הלא נכון יכולים למחוק את החיסכון שהושג במספר הטוקנים.
השיפור הנטען בשיקול דעת אינו מחליף מגבלות הרשאה. סוכן שמקבל גישה לטרמינל, למסד נתונים או לשירות ענן עדיין צריך סביבת ניסוי, אישור לפני פעולות משנות מצב ותיעוד מלא של קריאות הכלים. עצם העובדה שהמודל שואל יותר שאלות או מזהה מכשול אינה מבטיחה שהוא יזהה כל מצב מסוכן.
מה עדיין לא ידוע
Meta לא מסרה מועד מדויק ל־max reasoning או לפרסום המשקולות הפתוחות שעליהן היא מדברת. לא ברור גם כיצד הביצועים משתנים בין שפות, מאגרי קוד גדולים וכלים שאינם חלק ממערך הבדיקות שלה. ההשקה נותנת למפתחים מוצר שאפשר למדוד עכשיו, אבל ההכרעה אם הוא יעיל יותר תגיע מבדיקות עומס, עלות ואמינות מחוץ לסביבת Meta.
מקורות
VibeTech
כתב/ת טכנולוגיה ב-VibeTech



