Сервис развивается: тестируем формат, собираем идеи, улучшаем сервис. Есть идеи? Написать
Дайджесты новостей
Визуализация проектирования уникального тембра голоса и эмоциональной режиссуры синтеза речи.

Дизайн голоса и эмоции: запуск моделей Google Gemini 3.8 Flash TTS

Синтез речи долгое время оставался компромиссом между роботизированной монотонностью быстрых решений и колоссальными затратами на обучение персонализированных моделей дикторов. Компания Google представила специализированное семейство моделей синтеза речи нового поколения: Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS, ставшие доступными в интерфейсе Google AI Studio и через Gemini API.

Новая линейка разделена по целевым сценариям применения:

  • Flash TTS ориентирована на студийный продакшн, запись аудиокниг, кинематографическую озвучку и подкасты, где на первом месте стоит глубина артикуляции и богатство эмоциональных интонаций.
  • Flash-Lite TTS создана для высоконагруженных сценариев реального времени: голосовых роботов поддержки, интерактивных ассистентов и потокового перевода видео с минимальной задержкой ответа.

Текстовый дизайн тембра и мгновенное клонирование

Главным технологическим прорывом стал механизм Voice Design — проектирование уникального голоса на основе текстового описания. Разработчику больше не нужно искать актеров озвучивания или собирать датасеты: достаточно задать характеристики тембра на естественном языке («уверенный глубокий баритон мужчины 40 лет с мягкими доверительными интонациями и легким эхом радиостудии»). Модель формирует стабильный голосовой профиль, который можно многократно переиспользовать в проекте.

Кроме того, система поддерживает быстрое клонирование любого реального голоса всего по 30-секундному образцу чистой речи.

Вторая ключевая возможность — построчная эмоциональная режиссура (Line Directing). Прямо в тексте реплики можно использовать специальные теги для управления невербальными проявлениями: шепотом, вздохами, смехом, смысловыми паузами и резким изменением темпа речи.

Пример запроса к эндпоинту Flash TTS через утилиту cURL:

curl -X POST "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash-tts:synthesizeSpeech?key=${GEMINI_API_KEY}" \
  -H "Content-Type: application/json" \
  -d '{
    "input": {
      "text": "Добро пожаловать в выпуск! [whisper] Но самое интересное мы оставили под конец. [laugh]"
    },
    "voiceConfig": {
      "voiceDesign": {
        "description": "Энергичный диктор подкаста, мужской глубокий голос, чистая русская речь, естественные интонации"
      }
    },
    "audioConfig": {
      "audioEncoding": "MP3"
    }
  }' > output.mp3

Диалоги двух дикторов и подкасты

Модели Gemini 3.8 Flash TTS поддерживают нативную генерацию цельных диалогов между двумя независимыми собеседниками в рамках одного аудиопотока. Модель органично воспроизводит живые реакции второго плана (backchanneling), естественные перебивания и смену эмоционального фона.

Пример генерации двухголосного диалога через официальный Python SDK:

from google import genai

client = genai.Client()

response = client.models.synthesize_speech(
    model="gemini-3.8-flash-tts",
    contents=[
        {"speaker": "Алексей", "text": "Ты слышал новость про новые аудиомодели Google?"},
        {"speaker": "Мария", "text": "Да, Flash TTS умеет даже шептать и смеяться прямо по тексту!"}
    ],
    config={
        "speakers": {
            "Алексей": {"voice_description": "Уверенный баритон, 35 лет"},
            "Мария": {"voice_description": "Яркое меццо-сопрано, живой темп речи"}
        },
        "response_mime_type": "audio/mp3"
    }
)

with open("podcast_dialogue.mp3", "wb") as f:
    f.write(response.audio_bytes)

Практические нюансы эксплуатации

При генерации объемных материалов (например, многочасовых аудиокниг) разработчикам рекомендуется разбивать текст на смысловые фрагменты и явно передавать идентификатор диктора (Speaker ID), чтобы избежать микроскопического дрейфа тембра между главами. На редких языках эмоциональные теги шепота и смеха требуют предварительного тестирования, тогда как на основных языках мира качество синтеза уже неотличимо от студийной дикторской начитки.

Резюме релиза

Выход Gemini 3.8 Flash TTS кардинально удешевляет создание качественного аудиоконтента: студийная озвучка с тонкой интонационной драматургией теперь доступна в рамках стандартного API-вызова.