Пользовательские записи позволяют создавать гибридных голосовых агентов, которые используют ваше предзаписанное аудио в ключевых местах разговора, а для динамических ответов переключаются на речь, сгенерированную LLM (через клонированный голос). Так вы получаете лучшее из двух подходов: эмоциональную глубину реальной человеческой речи и гибкость диалога, порождаемого ИИ.

Зачем использовать пользовательские записи?

  • Ниже стоимость TTS — предзаписанное аудио проигрывается напрямую, поэтому TTS-синтез для этих сегментов не тарифицируется.
  • Эмоциональная вариативность — реальные записи несут естественную интонацию и эмоции, которые TTS не всегда может воспроизвести.
  • Меньше задержка — проиграть готовый клип быстрее, чем синтезировать текст во время звонка.

Требования

  • Провайдер TTS с поддержкой клонирования голоса (например, Cartesia или ElevenLabs).
  • API-ключ выбранного провайдера TTS, настроенный в настройках голоса.

Шаг 1: Клонируйте свой голос

Клонируйте голос у своего провайдера TTS, чтобы динамически сгенерированная речь звучала похоже на ваши записи. Например, с Cartesia:
  1. Зайдите в Cartesia и откройте Instant Clone.
  2. Запишите короткий аудиофрагмент (до 10 секунд) со своим голосом.
  3. Дайте клону имя и выберите язык.
  4. Скопируйте Voice ID — он понадобится на следующем шаге.
Можно использовать любого провайдера TTS с поддержкой клонирования голоса. Шаги отличаются от провайдера к провайдеру, но результат всегда один — Voice ID, привязанный к клонированному голосу.

Шаг 2: Настройте клонированный голос в Агентике

  1. Откройте конфигурацию моделей вашего агента в панели управления Агентики.
  2. В настройках голоса выберите Добавить Voice ID вручную.
  3. Вставьте Voice ID вашего клонированного голоса.
  4. Убедитесь, что провайдер совпадает с тем, где вы клонировали голос (например, Cartesia).
  5. Введите API-ключ провайдера, если еще не сделали этого.
  6. Сохраните конфигурацию.

Шаг 3: Загрузите записи

Откройте раздел Медиатека в панели управления Агентики. Записи общие для всех агентов в вашей организации. Можно загрузить заранее записанные аудиофайлы или записать аудио прямо в браузере. Для каждой записи:
  1. Нажмите Загрузить запись.
  2. Выберите аудиофайл или нажмите Записать, чтобы записать в браузере.
  3. Проверьте, что транскрипт корректен; при необходимости отредактируйте.
  4. Нажмите Загрузить.
ID записи можно переименовать в любой момент через иконку редактирования рядом с ней в списке записей.

Шаг 4: Соберите воркфлоу

Откройте воркфлоу агента и опишите разговор на естественном языке. Чтобы вставить запись, введите @ в редакторе промптов: появится список всех доступных записей в организации. Если вопрос пользователя выходит за пределы ваших записей, агент автоматически сгенерирует динамический ответ через LLM, а затем синтезирует его клонированным голосом через TTS.
Гибридный режим через @-упоминание работает только для стандартных агентов (цепочка STT → LLM → TTS). Realtime-модели speech-to-speech генерируют звук напрямую и не воспроизводят заранее записанные клипы.

Другие места, где можно использовать записи

@-упоминание выше позволяет LLM самой решать, когда проиграть запись. Но запись можно закрепить и за конкретной точкой сценария, где она проигрывается всегда. В каждом из этих полей есть переключатель Текст / Аудио — выберите Аудио и запись из списка. Клонирование голоса нужно только если запись стоит рядом с динамической речью и вы хотите, чтобы они звучали одинаково; сам по себе клип просто проигрывается как загружен.

Приветствие узла

В узле «Начало звонка» задайте Тип приветствия → Заранее записанное аудио, затем выберите Запись приветствия. Клип проиграется как первая реплика звонка вместо синтезированного через TTS приветствия. (Оставьте Текст (TTS), чтобы произнести текстовое приветствие, или пустым — чтобы пропустить приветствие.)

Реплика перехода

На любом ребре (условии) поле Реплика перехода позволяет агенту произнести короткую фразу во время перехода от одного узла к другому — чтобы скрыть задержку. Переключите его на Аудио, чтобы проиграть запись (например, «Секунду, сейчас посмотрю»). Реплика перехода не попадает в контекст разговора и не влияет на следующий ход LLM.

Сообщения инструментов

Инструменты могут проигрывать запись в ключевые моменты:
  • Перед медленным инструментом — HTTP/API-инструмент может произнести сообщение, пока ждёт ответа от внешнего вызова (например, «Сейчас проверю»). Задайте тип сообщения Заранее записанное аудио и выберите запись.
  • Прощание при завершении звонка — инструмент «Завершение звонка» может проиграть прощальное сообщение перед отключением. Варианты: Без сообщения, Пользовательское сообщение (произносится через TTS) или Заранее записанное аудио.

Фоновый шум и музыка на удержании

Ещё две аудиофункции проигрывают встроенные или загруженные ассеты и не требуют клонирования голоса:
  • Фоновый шум — в разделе Настройки → Основные → Фоновый шум включите фоновый звук, чтобы разговор звучал естественнее. Настройте Громкость и либо оставьте стандартный офисный фон, либо загрузите свой аудиофайл (до 10 МБ). Звук непрерывно подмешивается под речь агента.
  • Музыка на удержании — во время перевода звонка абонент автоматически слышит музыку на удержании, пока перевод обрабатывается. Используется встроенный ассет, настройка не нужна.

Советы для лучшего результата

  • Записывайте в тихой среде, чтобы улучшить качество аудио и согласованность с клонированным голосом.
  • Используйте pro-клонирование (где доступно) и давайте больше образцов аудио для более качественного клона голоса.
  • Держите записи короткими — короткие сфокусированные клипы лучше подходят для конкретных моментов разговора.
  • Просматривайте записи звонков после тестов, чтобы найти места, где переход между предзаписанным и динамическим аудио можно улучшить.