Голосовой агент, который быстро понимает вопрос и отвечает без заметной задержки, работает в контуре РФ, подключается к телефонии, и при этом не разгоняет расходы на инфраструктуру.
Задержка здесь обычно упирается не в саму модель, а в связку «распознавание речи → ответ → синтез голоса»: каждое звено считаем отдельно, чтобы понять, где теряется время. Для контура РФ и контроля расходов смотрим в сторону локального или гибридного размещения — такой опыт у нас есть по направлению 152-ФЗ (хранение данных на своём оборудовании), применяем его подход и здесь.
Голосовые сценарии нуждаются в донастройке на реальных звонках: сопровождение после запуска покрывает донастройку сценариев и мониторинг задержки.
GeekOnAI