Усовершенствование крупных аудио-ланговых моделей с приземлением на уровне рамы для тонкозернистого временного восприятия

#Усовершенствование #Annuate #Type #Большие #Language

arXiv: 2609.15215v1 Annuate Type: кросс-бюллетени: Большие аудиовизуальные Language Models (LALMS) значительно улучшили общее аудиопонимание, однако они попрежнему ограничены в мелкозернистых временных восприятиях, особенно при точном локализации событий. Существующие подходы, главным образом после обучения LALM для прогнозирования границ событий в качестве символов времени. Вместе с тем, эта эластичная формула не имеет четкой корреляции между прогнозами времени и мелкозернистыми акустическими доказательствами, что ограничивает точность и надежность временны́х локализаций. Для решения этой проблемы мы расширяем LALM с помощью специализированной модели заземления на уровне рамы, используя при этом ее возможности семантического моделирования для представления запроса события. В частности, замороженный LALM кодирует запрос события как контекст, и заземленная модель сочетает эти представления запроса с тонкими аудиоэлементами для локализации целевого события на уровне кадра. Широкомасштабные эксперименты с использованием различных временных контрольных показателей заземления