У Yandex SpeechKit есть переключатель Streaming (потоковый режим). Выключен (по умолчанию) — используется сегментированный API распознавания v1; включён — переключает на потоковый распознаватель реального времени v3 с определением конца фразы на стороне сервера, что может снижать задержку смены реплик для звонков на русском языке.
Конфигурации
Транскрайбер
Голосовые агенты используют STT (распознавание речи) для транскрибирования того, что говорит пользователь. Этот транскрибированный текст передаётся в LLM для генерации ответа, который воспроизводится пользователю.
В управляемом пайплайне Агентики доступны транскрайберы Yandex (SpeechKit) и Agentic STT на базе T-Bank VoiceKit. Вы можете свериться с документацией провайдеров, чтобы выбрать язык под ваши требования.