Зачем использовать custom recordings?
- Меньше TTS-стоимость — предзаписанное аудио проигрывается напрямую, поэтому TTS-синтез для этих сегментов не тарифицируется.
- Эмоциональная вариативность — реальные записи несут естественную интонацию и эмоции, которые TTS не всегда может воспроизвести.
- Меньше задержка — проиграть готовый клип быстрее, чем синтезировать текст во время звонка.
Требования
- TTS provider с поддержкой клонирования голоса (например, Cartesia или ElevenLabs).
- API key выбранного TTS provider, настроенный в Voice settings.
Шаг 1: Клонируйте свой голос
Клонируйте голос у своего TTS provider, чтобы динамически сгенерированная речь звучала похоже на ваши записи. Например, с Cartesia:- Зайдите в Cartesia и откройте Instant Clone.
- Запишите короткий аудиофрагмент (до 10 секунд) со своим голосом.
- Дайте клону имя и выберите язык.
- Скопируйте Voice ID — он понадобится на следующем шаге.
Можно использовать любой TTS provider с поддержкой клонирования голоса. Шаги отличаются от провайдера к провайдеру, но результат всегда один — Voice ID, привязанный к клонированному голосу.
Шаг 2: Настройте клонированный голос в Агентике
- Откройте Model Configuration вашего агента в dashboard Агентики.
- В voice settings выберите Add Voice ID manually.
- Вставьте Voice ID вашего клонированного голоса.
- Убедитесь, что provider совпадает с тем, где вы клонировали голос (например, Cartesia).
- Введите API key provider, если еще не сделали этого.
- Сохраните конфигурацию.
Шаг 3: Загрузите recordings
Откройте страницу Recordings в dashboard Агентики. Recordings общие для всех агентов в вашей организации. Можно загрузить заранее записанные аудиофайлы или записать аудио прямо в браузере. Для каждой записи:- Нажмите Upload Recording.
- Выберите аудиофайл или нажмите Record, чтобы записать в браузере.
- Проверьте, что transcription корректен; при необходимости отредактируйте.
- Нажмите Upload.
Шаг 4: Соберите workflow
Откройте workflow агента и опишите разговор на естественном языке. Чтобы вставить запись, введите@ в prompt editor: появится список всех доступных recordings в организации.
Если вопрос пользователя выходит за пределы ваших recordings, агент автоматически сгенерирует динамический ответ через LLM, а затем синтезирует его клонированным голосом через TTS.
Гибридный режим через
@-упоминание работает только для стандартных агентов (цепочка STT → LLM → TTS). Realtime-модели speech-to-speech генерируют звук напрямую и не воспроизводят заранее записанные клипы.Другие места, где можно использовать записи
@-упоминание выше позволяет LLM самой решать, когда проиграть запись. Но запись можно закрепить и за конкретной точкой сценария, где она проигрывается всегда. В каждом из этих полей есть переключатель Текст / Аудио — выберите Аудио и запись из списка. Клонирование голоса нужно только если запись стоит рядом с динамической речью и вы хотите, чтобы они звучали одинаково; сам по себе клип просто проигрывается как загружен.
Приветствие узла
В узле Start задайте Тип приветствия → Заранее записанное аудио, затем выберите Запись приветствия. Клип проиграется как первая реплика звонка вместо синтезированного через TTS приветствия. (Оставьте Текст (TTS), чтобы произнести текстовое приветствие, или пустым — чтобы пропустить приветствие.)Реплика перехода
На любом ребре (условии) поле Реплика перехода позволяет агенту произнести короткую фразу во время перехода от одного узла к другому — чтобы скрыть задержку. Переключите его на Аудио, чтобы проиграть запись (например, «Секунду, сейчас посмотрю»). Реплика перехода не попадает в Conversation Context и не влияет на следующий ход LLM.Сообщения инструментов
Инструменты могут проигрывать запись в ключевые моменты:- Перед медленным инструментом — HTTP/API-инструмент может произнести сообщение, пока ждёт ответа от внешнего вызова (например, «Сейчас проверю»). Задайте тип сообщения Заранее записанное аудио и выберите запись.
- Прощание при завершении звонка — инструмент End Call может проиграть прощальное сообщение перед отключением. Варианты: Без сообщения, Пользовательское сообщение (произносится через TTS) или Заранее записанное аудио.
Фоновый шум и музыка на удержании
Ещё две аудиофункции проигрывают встроенные или загруженные ассеты и не требуют клонирования голоса:- Фоновый шум — в разделе Настройки → Основные → Фоновый шум включите фоновый звук, чтобы разговор звучал естественнее. Настройте Громкость и либо оставьте стандартный офисный фон, либо загрузите свой аудиофайл (до 10 МБ). Звук непрерывно подмешивается под речь агента.
- Музыка на удержании — во время перевода звонка абонент автоматически слышит hold music, пока перевод обрабатывается. Используется встроенный ассет, настройка не нужна.
Советы для лучшего результата
- Записывайте в тихой среде, чтобы улучшить качество аудио и согласованность с клонированным голосом.
- Используйте pro-клонирование (где доступно) и давайте больше образцов аудио для более качественного клона голоса.
- Держите recordings короткими — короткие сфокусированные клипы лучше подходят для конкретных моментов разговора.
- Просматривайте call recordings после тестов, чтобы найти места, где переход между предзаписанным и динамическим аудио можно улучшить.