Radar AI Avatar Transparent

עליבאבא משיקה מודל שמבין קול, תמונה ווידאו יחד וזול משמעותית

חטיבת ה-AI של עליבאבא, Qwen, השיקה את Qwen3.8-Omni-Flash — מודל רב-מודלי מובנה שמעבד טקסט, תמונה, אודיו ווידאו יחד בתוך אותה רשת, ולא באמצעות רכיבים נפרדים שמחוברים זה לזה. זהו הצעד האחרון של עליבאבא בתחרות מול גוגל ו-OpenAI על שוק המודלים הרב-מודליים, שהופך מרכזי יותר ככל שסוכני AI נדרשים להבין וידאו ואודיו בזמן אמת.

המודל תומך בחלון הקשר של מיליון טוקנים תוך שמירה על ביצועי טקסט קרובים למודל טקסט-בלבד באותו גודל. לפי עליבאבא, הציון הממוצע שלו השתפר ביותר מ-25% על פני כ-29 מבחני הערכה בהשוואה לגרסה הקודמת, Qwen3.5-Omni-Plus, ולפי נתוני עליבאבא, הוא עוקף את Gemini 3.8 Flash של גוגל בבנצ'מרק LongAudioSpan להבנת אודיו ארוך. במקביל, מחיר ה-API לקלט אודיו צנח ביותר מ-98%, ולקלט אודיו-ויזואלי ביותר מ-93%, לעומת הגרסה הקודמת.

המודל זמין כבר עכשיו דרך פלטפורמת Qianwen ו-Alibaba Cloud Model Studio, עם נקודות קצה בבייג'ינג ובסינגפור. לצדו פרסמה עליבאבא גם שני כלים משלימים — Qwen-MM-Plugins ו-Qwen-Live Harness — המיועדים לעבודה סוכנית ארוכת-טווח ולאינטראקציה רב-מודלית בזמן אמת, כמו סיכום פגישות או ניתוח וידאו ארוך.

מקורות: MarkTechPost · TechNode

QR לתשלום ביטקוין אל bc1qsn043qmlv4ejxydeknkfm9u6e93e6tegmq9x85

₿ אהבת את הפוסט?

אפשר לשלוח לי ביטקוין ישירות לכתובת שלי. סרקו את הקוד, או העתיקו את הכתובת:

bc1qsn043qmlv4ejxydeknkfm9u6e93e6tegmq9x85

שימו לב: העברה on-chain כרוכה בעמלת רשת שאינה תלויה בסכום, ולכן סכומים קטנים מאוד אינם כדאיים.

--:--:--
-