חוקר OpenAI בוחן דפי הרצה ומפעיל תחנות ניסוי מקבילות בחדר בקרה
בינה מלאכותית

OpenAI מדווחת: סוכני הקוד הגיעו לרמת ״מתמחה מחקר״

VibeTech 3 דק׳ קריאה 1 צפיות7 בספטמבר 2026

OpenAI אומרת שסוכני הקוד שלה כבר משלימים משימות מחקר מוגדרות שנמשכות ימים, אך הנתונים הפנימיים מראים שבני אדם עדיין קובעים כיוון, מתערבים בריצות ומחליטים אילו תוצאות ראויות להמשך.

OpenAI פרסמה ב-6 בספטמבר תמונת מצב מתוך עבודת המחקר הפנימית שלה וטענה שהגיעה לאבן הדרך שהיא מכנה ״מתמחה מחקר אוטומטי״. ההגדרה מצומצמת למדי: סוכן שמסוגל להשלים תחת הכוונה אנושית משימות מחקר מוגדרות היטב, מהסוג שהיה דורש מחוקר מיומן כמה ימי עבודה. החברה אינה טוענת שהמערכת בוחרת לבדה שאלות מחקר או מנהלת תוכנית ניסויים שלמה.

מה נמדד בפועל

המדד המרכזי של OpenAI הוא זמן הריצה המצטבר של סוכני קוד לכל יום עבודה של חוקר. באמצע אוגוסט הגיע הנתון ל-3.1 ״ימי עבודה של סוכן״ עבור כל יום עבודה אנושי. זהו מדד של פעילות מחשוב מקבילה, ולא המרה ישירה של שעות מחשב לתפוקה מדעית. סוכן יכול לנסות כיוון שגוי, להיתקע או להפיק תוצאה שחוקר יחליט שלא לקדם.

לצד זמן הריצה, החברה בדקה גם את מספר הניסויים שבוצעו לכל עובד שהיה פעיל בניסויים. באוגוסט הגיע המדד לרמה הגבוהה ביותר מאז ינואר 2025. OpenAI מציגה זאת כסימן לכך שחוקרים מריצים יותר בדיקות במקביל, אך לא פרסמה במאמר נתון שמבודד את השפעת הסוכנים מגורמים אחרים כמו שינויים בגודל הצוות, בכלי העבודה או בסוג הפרויקטים.

ההתערבות האנושית עדיין שכיחה

הנתון שמבהיר את גבולות ההישג נוגע למשימות הארוכות. ביותר ממחצית מהריצות המוצלחות שנמשכו בין ארבע לשמונה שעות נדרשה לפחות התערבות אנושית אחת. ההתערבות יכולה להיות תיקון כיוון, מתן הקשר נוסף או החלטה כיצד לפרש תוצאה. גם התכנון ברמה הגבוהה נשאר ברובו בידי החוקרים.

בפועל, חלוקת העבודה דומה לעבודה עם עמית זוטר: האדם מנסח את השאלה, מגדיר תנאי הצלחה ובודק אם התוצאה מצדיקה ניסוי נוסף. הסוכן מבצע חלקים שניתנים לפירוק, כמו כתיבת קוד ניסויי, הרצות חוזרות וניתוח ראשוני. היכולת להפעיל כמה משימות במקביל עשויה לקצר את ההמתנה בין רעיון למשוב, במיוחד בניסויים שקל לאמת.

אבן דרך פנימית, לא מבחן חיצוני

הנתונים נאספו בתוך OpenAI ובכלי העבודה שלה. הם אינם מגיעים ממבחן עצמאי ואינם מוכיחים שהמערכת תעבוד באותה יעילות במעבדה אחרת. גם ITmedia, שסיקרה את הפרסום, הדגישה את ההבחנה בין ביצוע משימות תחת פיקוח לבין קבלת החלטות מחקר עצמאית.

OpenAI קבעה בעבר יעד להגיע ל״חוקר AI אוטומטי״ עד מרץ 2028. הפרסום הנוכחי הוא תחנת ביניים בדרך ליעד הזה. השאלה החשובה בחודשים הקרובים תהיה אם החברה תציג מדדים של איכות ותועלת, ולא רק של משך ריצה וכמות ניסויים: כמה תוצאות עברו בדיקה, כמה שינו כיוון מחקר, וכמה זמן אנושי נחסך לאחר שמחשבים גם את הפיקוח והתיקונים.

מקורות

  1. OpenAI
  2. ITmedia NEWS7.9.2026
AIOpenAICodexסוכני AIמחקר
VibeTech

VibeTech

כתב/ת טכנולוגיה ב-VibeTech