Gemini 3.8 Flash TTS дава на потребителите по-прецизен контрол върху AI генерираната реч, включително глас, акцент, емоции, темпо и начина, по който се изпълнява всяка реплика.
Google представи Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS, два нови модела за преобразуване на текст в реч, насочени към подобряване на начина, по който звучи генерираният от изкуствен интелект говор.
Моделите могат да създават гласове по описание, да следват подробни указания за начина на говорене, да обработват разговори между двама говорители и да запазват последователността на гласовете при по-дълги записи.
За потребителите, които използват Gemini за озвучаване, подкасти, аудиокниги или глас зад кадър във видеа, обновлението дава по-голям контрол върху крайния аудио резултат. Потребителите могат да опишат какъв глас искат и да зададат как да бъде произнесена всяка отделна реплика.
Потребителите могат да задават как да звучи гласът
Gemini 3.8 Flash TTS може да създава глас от описание на естествен език. Потребителите могат да зададат персонаж, акцент и други гласови характеристики или да изберат измежду повече от 2000 съществуващи гласа.
Моделите поддържат над 100 езика и диалекта.
Указания могат да се добавят и в различни части от сценария. Например определена реплика може да бъде прошепната, изговорена по-бавно, произнесена с различна емоция или да включва смях, въздишки, ахване и разговорни реакции като „мхм“ или „да“.
Обновлението позволява и генериране на разговор между двама говорители от един сценарий, като гласовете и темпото могат да останат последователни при по-дълги записи.
Персонализираните гласове могат също да бъдат запазвани и използвани отново в различни проекти. Това трябва да помогне един и същ персонаж или разказвач да запази сходно звучене във времето.
Google планира по-късно да добави и възможност за ремиксиране на гласове. Тя ще позволява съществуващи гласове да бъдат променяни по отношение на височина, темпо, тембър и акцент.
Репликирането на глас има допълнителни ограничения
Gemini може да пресъздаде последователен гласов профил от 30-секунден запис, но не може просто да бъде използвана произволна гласова проба.
Според Google записът трябва да принадлежи на потребителя или той да има права да използва съответния глас. Собственикът на гласа трябва също да предостави отделен запис с устно съгласие, който съответства на говорителя от референтния запис, преди да бъде създадена реплика на гласа.
Генерираните Gemini Audio клипове съдържат и незабележим воден знак SynthID. Google посочва още, че репликирането на глас включва C2PA удостоверения, които да помагат при разпознаването на съдържание, генерирано с изкуствен интелект.
Gemini 3.8 Flash TTS се разпространява чрез Gemini Notebook, Gemini API и Google AI Studio.
По-евтиният модел Gemini 3.8 Flash-Lite TTS ще бъде достъпен в Google Vids и е предназначен за задачи в по-голям мащаб като дублаж, озвучаване и гласови агенти.
- ТЕМИ:
