Синтез речи долгое время оставался компромиссом между роботизированной монотонностью быстрых решений и колоссальными затратами на обучение персонализированных моделей дикторов. Компания Google представила специализированное семейство моделей синтеза речи нового поколения: Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS, ставшие доступными в интерфейсе Google AI Studio и через Gemini API.
Новая линейка разделена по целевым сценариям применения:
- Flash TTS ориентирована на студийный продакшн, запись аудиокниг, кинематографическую озвучку и подкасты, где на первом месте стоит глубина артикуляции и богатство эмоциональных интонаций.
- Flash-Lite TTS создана для высоконагруженных сценариев реального времени: голосовых роботов поддержки, интерактивных ассистентов и потокового перевода видео с минимальной задержкой ответа.
Текстовый дизайн тембра и мгновенное клонирование
Главным технологическим прорывом стал механизм Voice Design — проектирование уникального голоса на основе текстового описания. Разработчику больше не нужно искать актеров озвучивания или собирать датасеты: достаточно задать характеристики тембра на естественном языке («уверенный глубокий баритон мужчины 40 лет с мягкими доверительными интонациями и легким эхом радиостудии»). Модель формирует стабильный голосовой профиль, который можно многократно переиспользовать в проекте.
Кроме того, система поддерживает быстрое клонирование любого реального голоса всего по 30-секундному образцу чистой речи.
Вторая ключевая возможность — построчная эмоциональная режиссура (Line Directing). Прямо в тексте реплики можно использовать специальные теги для управления невербальными проявлениями: шепотом, вздохами, смехом, смысловыми паузами и резким изменением темпа речи.
Пример запроса к эндпоинту Flash TTS через утилиту cURL:
curl -X POST "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash-tts:synthesizeSpeech?key=${GEMINI_API_KEY}" \
-H "Content-Type: application/json" \
-d '{
"input": {
"text": "Добро пожаловать в выпуск! [whisper] Но самое интересное мы оставили под конец. [laugh]"
},
"voiceConfig": {
"voiceDesign": {
"description": "Энергичный диктор подкаста, мужской глубокий голос, чистая русская речь, естественные интонации"
}
},
"audioConfig": {
"audioEncoding": "MP3"
}
}' > output.mp3
Диалоги двух дикторов и подкасты
Модели Gemini 3.8 Flash TTS поддерживают нативную генерацию цельных диалогов между двумя независимыми собеседниками в рамках одного аудиопотока. Модель органично воспроизводит живые реакции второго плана (backchanneling), естественные перебивания и смену эмоционального фона.
Пример генерации двухголосного диалога через официальный Python SDK:
from google import genai
client = genai.Client()
response = client.models.synthesize_speech(
model="gemini-3.8-flash-tts",
contents=[
{"speaker": "Алексей", "text": "Ты слышал новость про новые аудиомодели Google?"},
{"speaker": "Мария", "text": "Да, Flash TTS умеет даже шептать и смеяться прямо по тексту!"}
],
config={
"speakers": {
"Алексей": {"voice_description": "Уверенный баритон, 35 лет"},
"Мария": {"voice_description": "Яркое меццо-сопрано, живой темп речи"}
},
"response_mime_type": "audio/mp3"
}
)
with open("podcast_dialogue.mp3", "wb") as f:
f.write(response.audio_bytes)
Практические нюансы эксплуатации
При генерации объемных материалов (например, многочасовых аудиокниг) разработчикам рекомендуется разбивать текст на смысловые фрагменты и явно передавать идентификатор диктора (Speaker ID), чтобы избежать микроскопического дрейфа тембра между главами. На редких языках эмоциональные теги шепота и смеха требуют предварительного тестирования, тогда как на основных языках мира качество синтеза уже неотличимо от студийной дикторской начитки.
Выход Gemini 3.8 Flash TTS кардинально удешевляет создание качественного аудиоконтента: студийная озвучка с тонкой интонационной драматургией теперь доступна в рамках стандартного API-вызова.
