Gemini 3.8 TTS: голос для озвучки текста теперь описывают словами
23 сентября Google выпустила две модели синтеза речи: Gemini 3.8 Flash TTS и более дешёвую Flash-Lite TTS. Главная перемена в том, как выбирают голос. Раньше вы брали готовый из списка, теперь можно описать нужный словами и получить новый. Плюс больше двух тысяч готовых голосов, свыше ста языков и диалектов и клон голоса по тридцатисекундной записи.
Голос по описанию вместо списка голосов
Обычный сценарий озвучки текста нейросетью выглядел так: открываете список, слушаете два десятка образцов, берёте ближайший. Если ни один не подошёл, работаете с тем, что есть.
Теперь голос задаётся текстом. Описываете возраст, тембр, манеру, темп, настроение, и модель собирает его. Библиотека перестаёт быть потолком: тридцать исходных голосов превращаются в сколько угодно вариантов под конкретную задачу.
Для подкастов и аудиокниг это снимает знакомую проблему, когда на весь проект есть три приличных голоса и все три уже звучали у конкурентов.
Построчная режиссура подачи
Вторая заметная вещь: интонацию можно задавать не на весь текст, а на каждую реплику. К строке добавляется пометка, как её произнести, и модель играет именно так.
Раньше единственным способом добиться нужной подачи было переписывать сам текст, добавляя «сказал он с сомнением». Теперь ремарка отделена от реплики, как в сценарии.
Туда же относится работа с двумя голосами в сцене и живые вставки вроде вдохов и коротких поддакиваний, которые отличают диалог от двух монологов подряд.
Клонирование голоса по 30 секундам
Свой голос воспроизводится по записи в полминуты. Google добавила два ограничения: нужно устное согласие владельца голоса, записанное отдельно, и в результат вшивается метка SynthID.
Метка невидима на слух и нужна, чтобы потом можно было определить происхождение записи. Стоит помнить об этом заранее: клонированный голос перестаёт быть анонимным файлом.
Про чужие голоса
Записать голос знакомого «на пробу» технически просто, юридически это чужой биометрический признак. Для коммерческой озвучки согласие нужно письменное, а не на словах.
Сколько языков и что с русским
Заявлено больше ста языков и диалектов, включая региональные варианты вроде квебекского французского, мексиканского испанского и шотландского английского. Русский в списке есть, но качество у моделей такого класса обычно ощутимо разное по языкам, и проверять его стоит на своём тексте, а не по демо на сайте.
Модели ранжировали в индексе качества Hume AI: две первые строчки занял как раз новый релиз. Индекс общий, по всем языкам сразу, и русского в отдельном разрезе там нет.
Чем две модели отличаются друг от друга
| Модель | Для чего | Особенность |
|---|---|---|
| Gemini 3.8 Flash TTS | игры, подкасты, аудиокниги, интерактив | тонкая режиссура подачи, дизайн голоса |
| Gemini 3.8 Flash-Lite TTS | дубляж и голосовые агенты потоком | дешевле, рассчитана на объём |
Разделение понятное. Когда вы озвучиваете главу книги, важна подача. Когда через вас идут тысячи коротких реплик голосового бота, важнее цена одной секунды.
Что проверить, прежде чем менять движок озвучки
Релизы синтеза речи выходят часто, и каждый раз кажется, что пора переезжать. Пять вещей, которые решают на практике больше, чем строчка в рейтинге.
- Ударения и числа. Русский синтез спотыкается на омографах и на датах с суммами. Прогоните абзац, где есть «замок», «дорога», «1 245,50 рубля» и фамилия.
- Длинная запись. Десять секунд звучат хорошо почти везде. Слушать надо двадцатую минуту, там вылезает усталость голоса и уползающий темп.
- Паузы по смыслу. Модель должна делать вдох там, где кончается мысль, а не там, где стоит точка в вашем тексте.
- Повторяемость. Один и тот же голос через неделю должен звучать так же, иначе серию роликов на нём не собрать.
- Иностранные слова внутри русской фразы. Названия продуктов и термины на латинице ломают многие движки.
Что с этим делать прямо сейчас
Обе модели доступны через Google AI Studio и Gemini API. В tenzor озвучка текста и дубляж видео работают на других движках, Gemini TTS мы пока не подключали и смотрим на неё по качеству русского.
Если вам нужна озвучка сегодня, порядок действий не меняется: берёте кусок реального текста на полминуты, прогоняете через доступные голоса и сравниваете на слух. Демо-ролики вендоров сделаны на удобных фразах, ваш текст почти всегда сложнее.
Что такое Gemini 3.8 TTS?+
Две модели синтеза речи от Google, вышедшие 23 сентября 2026 года: Flash TTS для выразительной озвучки и Flash-Lite TTS для больших объёмов. Главное отличие от прошлых версий — голос можно создать по текстовому описанию.
Можно ли клонировать свой голос?+
Да, по записи около 30 секунд. Google требует отдельно записанное устное согласие владельца голоса и вшивает в результат цифровую метку SynthID.
Поддерживается ли русский язык?+
Русский входит в список из более чем ста языков и диалектов. Качество по языкам различается, поэтому проверять лучше на собственном тексте, а не по демо-примерам.
Чем озвучка нейросетью отличается от старых синтезаторов речи?+
Старый синтез читал текст ровным голосом по правилам произношения. Современные модели держат интонацию и паузы по смыслу фразы, различают реплики нескольких говорящих и позволяют задавать манеру подачи отдельно от текста.
Что дальше почитать
- Как перевести голосовое в текст — обратная задача и как её решают.
- Как сделать видео из текста — куда потом подставить озвученную дорожку.
Озвучьте свой текст и послушайте
Возьмите абзац из реального проекта, а не пробную фразу: разница между голосами слышна именно на нём.
Открыть озвучку