חברת Black Forest Labs השיקה את FLUX 3, מודל בינה מלאכותית מאוחד המסוגל ליצור תמונות, קטעי וידאו עם סאונד מסונכרן וכן לנבא פעולות עבור זרועות רובוטיות בתעשייה.
מעבדות Black Forest Labs, המפתחת הגרמנית העומדת מאחורי סדרת מודלי התמונות FLUX.1, הכריזה על השקת FLUX 3 — מודל יסוד מולטימודלי מאוחד המשלב יצירת תמונות, וידאו, אודיו מסונכרן וניבוי פעולות עבור מערכות רובוטיות. בשונה מגישות קודמות שבהן שורשרו מספר מערכות נפרדות לעיבוד מדיה, FLUX 3 בנוי על ארכיטקטורת רשת יחידה הלומדת בו-זמנית מנתוני וידאו, קול, טקסט ותנועה בעולם הפיזי.
הדגם החדש זמין כעת בגישה מוקדמת מוגבלת עבור מפתחים ויוצרים. היכולת המרכזית המוצגת בשלב זה היא יצירת קטעי וידאו באורך של עד 20 שניות מתוך היגדי טקסט או תמונות מקור, תוך יצירה ניטיבית של פסקול מסונכרן הכולל דיאלוגים מרובי שפות, אפקטים קוליים וצלילי סביבה ישירות מתוך אותו מנוע עיבוד.
ממדיה דיגיטלית לבינה מלאכותית פיזית
החידוש המשמעותי ביותר ב-FLUX 3 אינו מתמצה רק באיכות הווידאו או בסאונד המשולב, אלא בהרחבת המודל לתחום הרובוטיקה והתפיסה המרחבית. החברה שילבה פעולה עם חברת הרובוטיקה mimic כדי להציג את FLUX-mimic, גרסה של המודל המאומנת לניבוי פעולות של זרועות רובוטיות במערכי ייצור ואוטומציה תעשייתית. המודל מסוגל לתרגם קלט ויזואלי והוראות טקסטואליות לרצף תנועות מדויק בעולם הממשי.
בחברה מסבירים כי התפיסה הוויזואלית, האקוסטית והמכנית הן כולן השתקפויות של אותה מציאות פיזית. על ידי אימון המודל על כל צורות הקלט הללו יחד, המערכת מבינה חוקים פיזיקליים, יחסי סיבתיות ודינמיקה בזמן בצורה עמוקה יותר בהשוואה למודלים המתמקדים בטקסט או בתמונות בלבד.
שלבי ההפצה והנגשת המודל לקהילה
הפצת FLUX 3 מתוכננת להתבצע במספר שלבים מדורגים. בשלב הראשון נפתחה הרשמה לגישה מוקדמת למודל הווידאו והרובוטיקה. מחולל התמונות הסטטיות של המודל צפוי להיפתח למשתתפים נוספים בשבועות הקרובים. בהמשך השנה מתכננת החברה לשחרר ממשקי API מורחבים, גרסאות משקל סגורות לארגונים, וכן גרסת משקלים פתוחים בשם FLUX 3 Dev לקהילת המפתחים והחוקרים.
החלטתה של Black Forest Labs להשיק תחילה את רכיבי הווידאו והרובוטיקה, בטרם שחרור מחולל התמונות הסטטיות, מסמנת שינוי אסטרטגי בולט. תחום מחוללי הווידאו הופך צפוף במהירות עם מתחרים כמו Sora ו-Veo, והחברה מנסה לבדל את עצמה באמצעות שילוב ניטיבי של קול וקשרי גומלין לעולם הפיזי.
מגבלות ואתגרים פתוחים
למרות ההתלהבות סביב ההכרזה, חלקים מרכזיים מהמודל עדיין אינם נגישים לקהל הרחב ומשתמשים ראשונים מדווחים כי זמני העיבוד עבור קטעי וידאו ואודיו ארוכים דורשים משאבי מחשוב כבדים במיוחד. כמו כן, הדיוק של המודל במשימות רובוטיות מורכבות בעולם האמיתי טרם נבחן באופן עצמאי בקנה מידה רחב, ויידרש זמן כדי לראות האם ארכיטקטורה מאוחדת מסוגלת להתחרות במערכות בקרה ייעודיות לרובוטיקה.
מקורות
- Black Forest Labs: FLUX 323.7.2026
- Black Forest Labs: FLUX 3 x mimic23.7.2026
- Q2B Studio coverage24.7.2026
VibeTech
כתב/ת טכנולוגיה ב-VibeTech

