Настраиваются в Models → BYOK, рядом с OpenAI и Yandex.
Embeddings и Speech-to-Speech не затронуты. Ни один из этих провайдеров не отдаёт
1536-мерные эмбеддинги и ни у одного нет realtime speech-to-speech API.
Российский корневой сертификат
GigaChat, SaluteSpeech и VoiceKit используют TLS-сертификаты, выпущенные УЦ Минцифры, которого нет в публичных CA-бандлах. Агентика поставляет этот УЦ вdeploy/certs/russian-trusted-bundle.pem и отдаёт его только клиентам, которые ходят
к этим трём хостам.
Он намеренно не устанавливается в системное хранилище доверия контейнера. УЦ в
системном хранилище может удостоверить любой хост, до которого дотягивается контейнер —
включая api.openai.com, — поэтому доверие ограничено конкретным клиентом. Чтобы указать
другой бандл, задайте RU_TRUSTED_CA_BUNDLE.
GigaChat (LLM)
Зарегистрируйтесь на developers.sber.ru через Sber ID; нужен российский номер телефона, обходного пути нет. Портал выдаёт ключ авторизации — этоbase64(client_id:client_secret). Вставьте всю эту строку в поле API Key.
Выберите Scope под класс вашего аккаунта: GIGACHAT_API_PERS (физлица), _B2B или
_CORP. Это разные проекты с разными ключами; смена класса означает новые учётные данные.
Физлицам доступен 1 млн токенов бесплатно на 12 месяцев при лимите 1 запрос в секунду —
этого не хватит на параллельные звонки. Лимиты конкурентности для B2B и CORP не
публикуются; уточняйте при заключении договора.
SaluteSpeech (Transcriber + Voice)
Тот же ключ авторизации, что у GigaChat, но другой Scope:SALUTE_SPEECH_PERS, _B2B
или _CORP.
Transcriber. Модель callcenter рассчитана на телефонию 8 кГц; general — значение по
умолчанию. EOU timeout задаёт длительность тишины, закрывающей фразу: меньше значение —
короче ход, но выше риск оборвать говорящего на полуслове.
Voice. SaluteSpeech выбирает частоту дискретизации через имя голоса, поэтому
Sample rate — отдельное поле с двумя вариантами: 8000 экономит один ресемпл на
телефонии, 24000 звучит лучше во всех остальных случаях. Управления скоростью и высотой
голоса нет: SaluteSpeech даёт их только через SSML, который Агентика не отправляет.
VoiceKit (Transcriber + Voice)
Доступ выдаётся по договору, а не самостоятельно: регистрация на developer.tbank.ru, заявка в поддержку, документы. Распознавание доступно физлицам и юрлицам, синтез — только юрлицам. Каталог голосов не публикуется — запрашивайте при заключении договора. VoiceKit выдаёт два секрета. API key идёт в полеAPI Key, secret key — в поле
Secret key; Агентика подписывает ими короткоживущий токен для каждого стрима.
T-one (Transcriber, self-hosted)
T-one — телефонный распознаватель Т-Банка, опубликованный под Apache-2.0 вместе с весами. Данные не покидают вашу инфраструктуру, аккаунт не нужен. Запуск:TONE_API_KEY, если нужен общий секрет между Агентикой и распознавателем; оставьте
пустым, когда контейнер доступен только из compose-сети. Другой адрес указывается через
TONE_BASE_URL.
Инференс идёт в один поток. Поднимайте TONE_INFERENCE_THREADS только после того, как
измерите под нагрузкой и пропускную способность, и корректность: референс-сервер T-one
гоняет инференс прямо в event loop, поэтому параллельный декод апстримом не проверялся.
Образ содержит модель размером ~1 ГБ и работает на CPU. Прогоните бенчмарк под вашу
целевую конкурентность, прежде чем ставить его на живые звонки: Т-Банк публикует цифры
пропускной способности для GPU, но не CPU real-time factor.