גוגל הכריזה על שני מודלים חדשים להמרת טקסט לדיבור, Gemini 3.8 Flash TTS ו-Gemini 3.8 Flash-Lite TTS, המתוארים כמודלי האודיו המבטאים ביותר שהחברה פיתחה עד כה. המודלים זמינים כבר היום ב-Gemini API וב-Google AI Studio, ובקרוב גם ב-Gemini Enterprise.
היכולת הבולטת היא שכפול קול: המערכת יכולה לשחזר פרופיל קולי עקבי מדגימת שמע של 30 שניות בלבד, בכפוף לאימות הסכמה של בעל הקול. אפשרות נוספת מאפשרת לעצב קול חדש מאפס לפי הנחיה בשפה טבעית — למשל בחירת טון, גיל או מבטא. המודלים תומכים ביותר מ-100 שפות ודיאלקטים, כולל גרסאות אזוריות כמו ספרדית מקסיקנית וצרפתית קוויבקית, ומעניקים גישה ליותר מ-2,000 קולות מוכנים לשימוש.
כל קובץ אודיו שנוצר מסומן בחותמת המים הדיגיטלית SynthID, המאפשרת לזהות אותו כתוכן שנוצר בידי AI. הצעד ממשיך מגמה של גוגל ומתחרותיה להטביע סימון בתוכן מסונתז — קול, תמונה או וידאו — כדי להקל על איתור זיופים.
מקורות: Google Blog

₿ אהבת את הפוסט?
אפשר לשלוח לי ביטקוין ישירות לכתובת שלי. סרקו את הקוד, או העתיקו את הכתובת:
bc1qsn043qmlv4ejxydeknkfm9u6e93e6tegmq9x85
שימו לב: העברה on-chain כרוכה בעמלת רשת שאינה תלויה בסכום, ולכן סכומים קטנים מאוד אינם כדאיים.