Custom recordings позволяют создавать гибридных голосовых агентов, которые используют ваше предзаписанное аудио в ключевых местах разговора и fallback на LLM-generated speech (через клонированный голос) для динамических ответов. Так вы получаете лучшее из двух подходов: эмоциональную глубину реальной человеческой речи и гибкость AI-generated диалога.

Зачем использовать custom recordings?

  • Меньше TTS-стоимость — предзаписанное аудио проигрывается напрямую, поэтому TTS-синтез для этих сегментов не тарифицируется.
  • Эмоциональная вариативность — реальные записи несут естественную интонацию и эмоции, которые TTS не всегда может воспроизвести.
  • Меньше задержка — проиграть готовый клип быстрее, чем синтезировать текст во время звонка.

Требования

  • TTS provider с поддержкой клонирования голоса (например, Cartesia или ElevenLabs).
  • API key выбранного TTS provider, настроенный в Voice settings.

Шаг 1: Клонируйте свой голос

Клонируйте голос у своего TTS provider, чтобы динамически сгенерированная речь звучала похоже на ваши записи. Например, с Cartesia:
  1. Зайдите в Cartesia и откройте Instant Clone.
  2. Запишите короткий аудиофрагмент (до 10 секунд) со своим голосом.
  3. Дайте клону имя и выберите язык.
  4. Скопируйте Voice ID — он понадобится на следующем шаге.
Можно использовать любой TTS provider с поддержкой клонирования голоса. Шаги отличаются от провайдера к провайдеру, но результат всегда один — Voice ID, привязанный к клонированному голосу.

Шаг 2: Настройте клонированный голос в Агентике

  1. Откройте Model Configuration вашего агента в dashboard Агентики.
  2. В voice settings выберите Add Voice ID manually.
  3. Вставьте Voice ID вашего клонированного голоса.
  4. Убедитесь, что provider совпадает с тем, где вы клонировали голос (например, Cartesia).
  5. Введите API key provider, если еще не сделали этого.
  6. Сохраните конфигурацию.

Шаг 3: Загрузите recordings

Откройте страницу Recordings в dashboard Агентики. Recordings общие для всех агентов в вашей организации. Можно загрузить заранее записанные аудиофайлы или записать аудио прямо в браузере. Для каждой записи:
  1. Нажмите Upload Recording.
  2. Выберите аудиофайл или нажмите Record, чтобы записать в браузере.
  3. Проверьте, что transcription корректен; при необходимости отредактируйте.
  4. Нажмите Upload.
ID записи можно переименовать в любой момент через edit icon рядом с ней в списке recordings.

Шаг 4: Соберите workflow

Откройте workflow агента и опишите разговор на естественном языке. Чтобы вставить запись, введите @ в prompt editor: появится список всех доступных recordings в организации. Если вопрос пользователя выходит за пределы ваших recordings, агент автоматически сгенерирует динамический ответ через LLM, а затем синтезирует его клонированным голосом через TTS.
Гибридный режим через @-упоминание работает только для стандартных агентов (цепочка STT → LLM → TTS). Realtime-модели speech-to-speech генерируют звук напрямую и не воспроизводят заранее записанные клипы.

Другие места, где можно использовать записи

@-упоминание выше позволяет LLM самой решать, когда проиграть запись. Но запись можно закрепить и за конкретной точкой сценария, где она проигрывается всегда. В каждом из этих полей есть переключатель Текст / Аудио — выберите Аудио и запись из списка. Клонирование голоса нужно только если запись стоит рядом с динамической речью и вы хотите, чтобы они звучали одинаково; сам по себе клип просто проигрывается как загружен.

Приветствие узла

В узле Start задайте Тип приветствияЗаранее записанное аудио, затем выберите Запись приветствия. Клип проиграется как первая реплика звонка вместо синтезированного через TTS приветствия. (Оставьте Текст (TTS), чтобы произнести текстовое приветствие, или пустым — чтобы пропустить приветствие.)

Реплика перехода

На любом ребре (условии) поле Реплика перехода позволяет агенту произнести короткую фразу во время перехода от одного узла к другому — чтобы скрыть задержку. Переключите его на Аудио, чтобы проиграть запись (например, «Секунду, сейчас посмотрю»). Реплика перехода не попадает в Conversation Context и не влияет на следующий ход LLM.

Сообщения инструментов

Инструменты могут проигрывать запись в ключевые моменты:
  • Перед медленным инструментом — HTTP/API-инструмент может произнести сообщение, пока ждёт ответа от внешнего вызова (например, «Сейчас проверю»). Задайте тип сообщения Заранее записанное аудио и выберите запись.
  • Прощание при завершении звонка — инструмент End Call может проиграть прощальное сообщение перед отключением. Варианты: Без сообщения, Пользовательское сообщение (произносится через TTS) или Заранее записанное аудио.

Фоновый шум и музыка на удержании

Ещё две аудиофункции проигрывают встроенные или загруженные ассеты и не требуют клонирования голоса:
  • Фоновый шум — в разделе Настройки → Основные → Фоновый шум включите фоновый звук, чтобы разговор звучал естественнее. Настройте Громкость и либо оставьте стандартный офисный фон, либо загрузите свой аудиофайл (до 10 МБ). Звук непрерывно подмешивается под речь агента.
  • Музыка на удержании — во время перевода звонка абонент автоматически слышит hold music, пока перевод обрабатывается. Используется встроенный ассет, настройка не нужна.

Советы для лучшего результата

  • Записывайте в тихой среде, чтобы улучшить качество аудио и согласованность с клонированным голосом.
  • Используйте pro-клонирование (где доступно) и давайте больше образцов аудио для более качественного клона голоса.
  • Держите recordings короткими — короткие сфокусированные клипы лучше подходят для конкретных моментов разговора.
  • Просматривайте call recordings после тестов, чтобы найти места, где переход между предзаписанным и динамическим аудио можно улучшить.