Платформа Агентика по умолчанию поддерживает движки TTS Yandex (SpeechKit), OpenAI и Агентика, а также опциональные российские суверенные голоса SaluteSpeech и VoiceKit. Дополнительно можно подключить по своему ключу ElevenLabs, Cartesia или self-hosted-эндпоинт локальных моделей (Speaches). По умолчанию доступны некоторые голоса от провайдеров. Вы можете свериться с API-документацией провайдеров, чтобы выбрать voice ID, наиболее подходящий под ваши требования к языку.
Провайдер синтеза получает текст, который сгенерировал агент, чтобы озвучить его. Прежде чем передавать персональные данные, изучите политику провайдера в части обработки, хранения, обучения моделей и региона размещения. Зарубежные провайдеры (OpenAI, ElevenLabs, Cartesia) означают, что этот текст передаётся за границу — убедитесь, что это допустимо по 152-ФЗ, либо используйте суверенные голоса.
Голоса ElevenLabs и Cartesia задаются как voice ID вручную, а не выбираются из выпадающего списка. Оба — зарубежные облака: включайте их только если трансграничная передача аудио звонков допустима для вашего развёртывания.
Для ElevenLabs по своему ключу доступен Flash v2.5. В управляемом режиме MPS доступны Flash v2.5 и Eleven v3. У Flash доступны четыре настройки характера голоса помимо скорости:
  • Стабильность (stability, 0–1) — ниже значение, больше эмоций и вариативности между репликами; выше — ровнее и монотоннее.
  • Схожесть с голосом (similarity_boost, 0–1) — насколько точно синтез следует исходному голосу.
  • Выразительность стиля (style, 0–1) — усиление манеры речи. 0 — минимальная задержка; высокие значения делают речь выразительнее, но менее стабильной.
  • Усиление диктора (use_speaker_boost) — повышает сходство с исходным диктором ценой небольшого роста задержки.
У Flash также доступна нормализация текста (apply_text_normalization: auto, on, off). Значения по умолчанию (0.8 / 0.75 / 0 / включено) совпадают с тем, что платформа отправляла до появления этих полей, поэтому сохранённые конфигурации звучат так же.У Eleven v3 доступны только стабильность и скорость: ElevenLabs не поддерживает для него similarity_boost и use_speaker_boost. Для эмоциональной подачи используйте аудиотеги в тексте, который генерирует агент.
BYOK Yandex TTS (в разделе Voice -> Yandex конфигурации провайдера) дополнительно предоставляет версию API синтеза SpeechKit (v1/v3, что влияет на доступный список голосов) и опции emotion/роли для отдельных голосов там, где голос это поддерживает — управляемый Агентикой каталог Yandex ниже не предоставляет управление emotion.
Если вы не нашли любимый голос, вы всегда можете добавить voice ID вручную. Добавить голос вручную

Управляемый Агентикой голос (MPS)

Когда ваш агент использует управляемый Агентикой пайплайн (open managed service на базе Yandex SpeechKit), голос, язык и скорость речи выбираются для каждого воркфлоу отдельно:
  1. Откройте ваш воркфлоу и перейдите на вкладку Settings.
  2. Выберите Model Overrides, затем подвкладку Агентика.
  3. Задайте:
    • Voice — выберите из каталога голосов Yandex SpeechKit. Можно фильтровать по полу и языку. Доступные голоса: alena, jane, omazh, oksana, dasha, julia, lera, masha, marina, alyss (женские) и filipp, ermil, zahar, alexander, kirill, anton, nick (мужские).
    • Language — например, ru-RU, en-US, kk-KK или uz-UZ.
    • Speed — скорость речи.
  4. Сохраните.
Выбор отправляется в managed service во время звонка, поэтому он вступает в силу при следующем запуске — переразвёртывание не требуется.
Если голос по умолчанию звучит невыразительно, попробуйте более выразительный — для русского языка jane или omazh; для английского задайте язык en-US и выберите nick или alyss.