Зачем использовать пользовательские записи?
- Ниже стоимость TTS — предзаписанное аудио проигрывается напрямую, поэтому TTS-синтез для этих сегментов не тарифицируется.
- Эмоциональная вариативность — реальные записи несут естественную интонацию и эмоции, которые TTS не всегда может воспроизвести.
- Меньше задержка — проиграть готовый клип быстрее, чем синтезировать текст во время звонка.
Требования
- Провайдер TTS с поддержкой клонирования голоса (например, Cartesia или ElevenLabs).
- API-ключ выбранного провайдера TTS, настроенный в настройках голоса.
Шаг 1: Клонируйте свой голос
Клонируйте голос у своего провайдера TTS, чтобы динамически сгенерированная речь звучала похоже на ваши записи. Например, с Cartesia:- Зайдите в Cartesia и откройте Instant Clone.
- Запишите короткий аудиофрагмент (до 10 секунд) со своим голосом.
- Дайте клону имя и выберите язык.
- Скопируйте Voice ID — он понадобится на следующем шаге.
Можно использовать любого провайдера TTS с поддержкой клонирования голоса. Шаги отличаются от провайдера к провайдеру, но результат всегда один — Voice ID, привязанный к клонированному голосу.
Шаг 2: Настройте клонированный голос в Агентике
- Откройте конфигурацию моделей вашего агента в панели управления Агентики.
- В настройках голоса выберите Добавить Voice ID вручную.
- Вставьте Voice ID вашего клонированного голоса.
- Убедитесь, что провайдер совпадает с тем, где вы клонировали голос (например, Cartesia).
- Введите API-ключ провайдера, если еще не сделали этого.
- Сохраните конфигурацию.
Шаг 3: Загрузите записи
Откройте раздел Медиатека в панели управления Агентики. Записи общие для всех агентов в вашей организации. Можно загрузить заранее записанные аудиофайлы или записать аудио прямо в браузере. Для каждой записи:- Нажмите Загрузить запись.
- Выберите аудиофайл или нажмите Записать, чтобы записать в браузере.
- Проверьте, что транскрипт корректен; при необходимости отредактируйте.
- Нажмите Загрузить.
Шаг 4: Соберите воркфлоу
Откройте воркфлоу агента и опишите разговор на естественном языке. Чтобы вставить запись, введите@ в редакторе промптов: появится список всех доступных записей в организации.
Если вопрос пользователя выходит за пределы ваших записей, агент автоматически сгенерирует динамический ответ через LLM, а затем синтезирует его клонированным голосом через TTS.
Гибридный режим через
@-упоминание работает только для стандартных агентов (цепочка STT → LLM → TTS). Realtime-модели speech-to-speech генерируют звук напрямую и не воспроизводят заранее записанные клипы.Другие места, где можно использовать записи
@-упоминание выше позволяет LLM самой решать, когда проиграть запись. Но запись можно закрепить и за конкретной точкой сценария, где она проигрывается всегда. В каждом из этих полей есть переключатель Текст / Аудио — выберите Аудио и запись из списка. Клонирование голоса нужно только если запись стоит рядом с динамической речью и вы хотите, чтобы они звучали одинаково; сам по себе клип просто проигрывается как загружен.
Приветствие узла
В узле «Начало звонка» задайте Тип приветствия → Заранее записанное аудио, затем выберите Запись приветствия. Клип проиграется как первая реплика звонка вместо синтезированного через TTS приветствия. (Оставьте Текст (TTS), чтобы произнести текстовое приветствие, или пустым — чтобы пропустить приветствие.)Реплика перехода
На любом ребре (условии) поле Реплика перехода позволяет агенту произнести короткую фразу во время перехода от одного узла к другому — чтобы скрыть задержку. Переключите его на Аудио, чтобы проиграть запись (например, «Секунду, сейчас посмотрю»). Реплика перехода не попадает в контекст разговора и не влияет на следующий ход LLM.Сообщения инструментов
Инструменты могут проигрывать запись в ключевые моменты:- Перед медленным инструментом — HTTP/API-инструмент может произнести сообщение, пока ждёт ответа от внешнего вызова (например, «Сейчас проверю»). Задайте тип сообщения Заранее записанное аудио и выберите запись.
- Прощание при завершении звонка — инструмент «Завершение звонка» может проиграть прощальное сообщение перед отключением. Варианты: Без сообщения, Пользовательское сообщение (произносится через TTS) или Заранее записанное аудио.
Фоновый шум и музыка на удержании
Ещё две аудиофункции проигрывают встроенные или загруженные ассеты и не требуют клонирования голоса:- Фоновый шум — в разделе Настройки → Основные → Фоновый шум включите фоновый звук, чтобы разговор звучал естественнее. Настройте Громкость и либо оставьте стандартный офисный фон, либо загрузите свой аудиофайл (до 10 МБ). Звук непрерывно подмешивается под речь агента.
- Музыка на удержании — во время перевода звонка абонент автоматически слышит музыку на удержании, пока перевод обрабатывается. Используется встроенный ассет, настройка не нужна.
Советы для лучшего результата
- Записывайте в тихой среде, чтобы улучшить качество аудио и согласованность с клонированным голосом.
- Используйте pro-клонирование (где доступно) и давайте больше образцов аудио для более качественного клона голоса.
- Держите записи короткими — короткие сфокусированные клипы лучше подходят для конкретных моментов разговора.
- Просматривайте записи звонков после тестов, чтобы найти места, где переход между предзаписанным и динамическим аудио можно улучшить.