Google выпустила ИИ-модели для синтеза речи Gemini 3.8 Flash TTS, которые умеют клонировать голос

Google представила Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS — две новые модели синтеза речи, которые превращают генерацию голоса из набора готовых вариантов в более гибкий инструмент для создания аудио. Модели позволяют создавать собственные голоса, управлять исполнением отдельных реплик и генерировать выразительные диалоги для игр, подкастов, аудиокниг и других проектов. Gemini 3.8 Flash TTS предназначена для создания персонажей и детального управления их голосами. С помощью текстовых запросов можно задать роль, акцент и характеристики голоса более чем для 100 языков и диалектов. В библиотеке также доступно более 2000 готовых голосов, включая региональные варианты мексиканского испанского, квебекского французского и шотландского английского. Отдельно Google добавила возможность клонирования голоса по 30-секундной аудиозаписи. Функция предназначена для собственного голоса или голоса, на использование которого получено право. Перед созданием копии система проверяет согласие владельца голоса, а полученное аудио защищается водяным знаком SynthID и метаданными C2PA. После выбора голоса разработчик может управлять каждой репликой отдельно с помощью текстовых указаний. Gemini способна менять темп и характер исполнения, использовать шёпот и другие элементы звуковой подачи, а также добавлять реакции в виде смеха, вздохов и коротких реплик.


Источник: 3DNews — https://3dnews.ru/1148941

Комментарии