חטיבת ה-AI של עליבאבא, Qwen, השיקה את Qwen3.8-Omni-Flash — מודל רב-מודלי מובנה שמעבד טקסט, תמונה, אודיו ווידאו יחד בתוך אותה רשת, ולא באמצעות רכיבים נפרדים שמחוברים זה לזה. זהו הצעד האחרון של עליבאבא בתחרות מול גוגל ו-OpenAI על שוק המודלים הרב-מודליים, שהופך מרכזי יותר ככל שסוכני AI נדרשים להבין וידאו ואודיו בזמן אמת.
המודל תומך בחלון הקשר של מיליון טוקנים תוך שמירה על ביצועי טקסט קרובים למודל טקסט-בלבד באותו גודל. לפי עליבאבא, הציון הממוצע שלו השתפר ביותר מ-25% על פני כ-29 מבחני הערכה בהשוואה לגרסה הקודמת, Qwen3.5-Omni-Plus, ולפי נתוני עליבאבא, הוא עוקף את Gemini 3.8 Flash של גוגל בבנצ'מרק LongAudioSpan להבנת אודיו ארוך. במקביל, מחיר ה-API לקלט אודיו צנח ביותר מ-98%, ולקלט אודיו-ויזואלי ביותר מ-93%, לעומת הגרסה הקודמת.
המודל זמין כבר עכשיו דרך פלטפורמת Qianwen ו-Alibaba Cloud Model Studio, עם נקודות קצה בבייג'ינג ובסינגפור. לצדו פרסמה עליבאבא גם שני כלים משלימים — Qwen-MM-Plugins ו-Qwen-Live Harness — המיועדים לעבודה סוכנית ארוכת-טווח ולאינטראקציה רב-מודלית בזמן אמת, כמו סיכום פגישות או ניתוח וידאו ארוך.
מקורות: MarkTechPost · TechNode

₿ אהבת את הפוסט?
אפשר לשלוח לי ביטקוין ישירות לכתובת שלי. סרקו את הקוד, או העתיקו את הכתובת:
bc1qsn043qmlv4ejxydeknkfm9u6e93e6tegmq9x85
שימו לב: העברה on-chain כרוכה בעמלת רשת שאינה תלויה בסכום, ולכן סכומים קטנים מאוד אינם כדאיים.