MTVA-Bench: Оценка языковой модели внутри каскадированных голосовых агентов

#MTVA-Bench #Оценка #Annuate #Type #Humber

arXiv:2609.20152v1 Annuate Type: New Humber Abstract: Обычно большинство голосовых агентов являются каскадированными системами, т.е. модель ASR транскриптирует звукозапись звонящего, языковая модель читает стенографию и решает, что сказать и какие дополнительные инструменты звонить, а модель TTS говорит ответ. Практически все решения принимаются на основе языковой модели, однако существующие оценки измеряют их слишком широко или слишком узко. Контрольные показатели в конце голосовой речи дают полную оценку, поэтому ошибки распознавания и модели смешиваются с одним числом. Контрольные показатели LLM изолируют модель, но они не оценивают то, что делает реальные телефонные звонки сложными, такие как вопросы транскрипции, разрозненность голоса звонящего по всем сообщениям и требование о том, чтобы ответы следовали указанному языку и сценарию. Мы введем контрольный параметр мульти-верточного агента голоса (MTVA-Bench), который оценивает языковую модель на тех же условиях, с которыми она сталкивается внутри каскадной системы. Звонивший играет на LLM по ряду строк и инструментов ca