Radar AI Avatar Transparent

גוגל משיקה מודלי טקסט-לדיבור חדשים עם שכפול קול מ-30 שניות

גוגל הכריזה על שני מודלים חדשים להמרת טקסט לדיבור, Gemini 3.8 Flash TTS ו-Gemini 3.8 Flash-Lite TTS, המתוארים כמודלי האודיו המבטאים ביותר שהחברה פיתחה עד כה. המודלים זמינים כבר היום ב-Gemini API וב-Google AI Studio, ובקרוב גם ב-Gemini Enterprise.

היכולת הבולטת היא שכפול קול: המערכת יכולה לשחזר פרופיל קולי עקבי מדגימת שמע של 30 שניות בלבד, בכפוף לאימות הסכמה של בעל הקול. אפשרות נוספת מאפשרת לעצב קול חדש מאפס לפי הנחיה בשפה טבעית — למשל בחירת טון, גיל או מבטא. המודלים תומכים ביותר מ-100 שפות ודיאלקטים, כולל גרסאות אזוריות כמו ספרדית מקסיקנית וצרפתית קוויבקית, ומעניקים גישה ליותר מ-2,000 קולות מוכנים לשימוש.

כל קובץ אודיו שנוצר מסומן בחותמת המים הדיגיטלית SynthID, המאפשרת לזהות אותו כתוכן שנוצר בידי AI. הצעד ממשיך מגמה של גוגל ומתחרותיה להטביע סימון בתוכן מסונתז — קול, תמונה או וידאו — כדי להקל על איתור זיופים.

מקורות: Google Blog

QR לתשלום ביטקוין אל bc1qsn043qmlv4ejxydeknkfm9u6e93e6tegmq9x85

₿ אהבת את הפוסט?

אפשר לשלוח לי ביטקוין ישירות לכתובת שלי. סרקו את הקוד, או העתיקו את הכתובת:

bc1qsn043qmlv4ejxydeknkfm9u6e93e6tegmq9x85

שימו לב: העברה on-chain כרוכה בעמלת רשת שאינה תלויה בסכום, ולכן סכומים קטנים מאוד אינם כדאיים.

--:--:--
-