Аудиовизуальный прогноз поворота в сценариях коктейлей

#Аудиовизуальный #Annuales #Type #Текущие #ПТТС

arXiv:2609.17056v1 Annuales Type: кросс-бюллетень: Текущие модели прогнозирования поворота (ПТТС) обеспечивают высокую эффективность контрольных показателей с контролируемыми акустическими условиями и чистыми звуковыми сигналами. Их обобщение в разговорах с переплетающейся речью и фоновым вмешательством по-прежнему недостаточно изучено. В ходе этого исследования мы оцениваем аудиовизуальные ПТТМ, подготовленные с использованием чистых данных на сложной пробной коктейль-партии из набора данных AVCocktail, и анализируем их адаптационное поведение в этой новой области. Экспериментальные результаты свидетельствуют о последовательном разложении показателей в аудио- и визуальной среде при шумных условиях, причем относительное снижение взвешенных значений F1 составляет до 38%. Уточнение в новой области повышает надежность, однако выгоды варьируются по различным условиям и зависят от размера имеющихся данных о подготовке. Эти выводы позволяют получить представление о различных возможностях обобщения и адаптации аудио- и визуальных условий, а также указывают на необходимость надежного моделирования