שני מודלי האודיו החדשים של Google זמינים ב-Gemini API ובמוצרים נבחרים. הם ממשיכים לדבר בזמן הפעלת כלים ברקע, אך Google מזהירה מהזיות, האטות ותקלות זמן קצוב.
Google השיקה ב-15 בספטמבר את Gemini 3.8 Live ואת Gemini 3.8 Live Extended Thinking, שני מודלים שנועדו לשיחות קוליות רציפות ולסוכנים שמפעילים כלים בזמן אמת. המודל הראשון מיועד לשימושים שבהם מהירות ועלות חשובות, והשני מוסיף עיבוד ארוך יותר למשימות מורכבות.
לפי מסמכי Google, שני המודלים מקבלים אודיו, תמונות, וידאו וטקסט, ומחזירים אודיו וטקסט. חלון הקלט מגיע עד 128 אלף טוקנים והפלט עד 64 אלף טוקנים. Gemini 3.8 Live יכול לנתח תמונה כמעט בזמן אמת, לזהות מעבר בין 97 שפות בתוך אותה שיחה ולהפעיל פונקציות ו-API ברקע בלי לעצור את הדיבור.
ב-Extended Thinking החישוב יכול להימשך במקביל לתשובה הקולית. זה שינוי חשוב למפתחים: המשתמש יכול לקבל אישור קולי שהבקשה נקלטה, בזמן שהמודל ממשיך להזמין כלי, לבדוק תוצאה או להתקדם במשימה רב-שלבית. התיעוד מציין ש-turnComplete כבר לא מבטיח שהמודל סיים לעבוד, ולכן הלקוח צריך להמשיך להאזין להודעות נוספות.
איפה המודלים זמינים
שני המודלים זמינים ב-Gemini API וב-Google AI Studio. Gemini 3.8 Live מגיע גם ל-Search Live, ואילו Extended Thinking מופץ ל-Gemini Live ולמנויי Google AI במוצרים מסוימים של Workspace, ובהם Docs, Gmail ו-Keep. בארגונים, ההפצה הראשונית מוגדרת כגרסה מוקדמת פרטית בחלק ממוצרי Gemini Enterprise, כך שאין עדיין זמינות אחידה לכל לקוח או לכל אזור.
ההשקה פונה בעיקר למפתחי מוקדי שירות, עוזרים קוליים ותהליכים שבהם המשתמש ממשיך לדבר בזמן שמערכת מבצעת פעולות. היא גם מאפשרת לבנות חוויה שמסתכלת דרך מצלמה ומגיבה בקול, למשל בהדרכה טכנית או פתרון תקלה. היכולת קיימת ברמת המודל והממשק; Google לא פרסמה מדדי הצלחה מלקוחות בקנה מידה גדול.
המספרים שדורשים בדיקה עצמאית
Google דיווחה ש-Extended Thinking הגיע לציון 82.6 במדד Speech to Speech Quality של Artificial Analysis, ל-68.6% ב-τ-Voice ול-35.1% ב-τ-Voice-banking. Android Authority דיווחה על אותם נתונים ועל ההפצה, אך לא הציגה בדיקה עצמאית של זמן תגובה, שיעור השלמת משימות או יציבות בשימוש ממושך. לכן נכון להתייחס לציונים כנתוני השקה של החברה.
כרטיס המודל מפורש יותר לגבי המגבלות. הידע הקבוע של המודל נעצר בינואר 2025, והוא עלול להזות, להגיב לאט או להיתקע בגלל timeout. Google אומרת שכל אודיו שנוצר על ידי המודלים מסומן ב-SynthID, אך הסימון אינו מבטל טעויות תוכן ואינו מחליף אימות של פעולות רגישות.
מבחינה מעשית, החידוש הוא שהקול כבר אינו רק שכבת קלט ופלט סביב צ'אט. המודל אמור לשמור שיחה זורמת בזמן שהוא רואה, חושב ומפעיל מערכות אחרות. לפני הטמעה בארגון עדיין צריך לבדוק הרשאות לכל כלי, טיפול בניתוקים, רישום פעולות ואישור אנושי לפעולות כספיות, רפואיות או תפעוליות.
מקורות
VibeTech
כתב/ת טכנולוגיה ב-VibeTech


