Видео-HolmesV2: Может ли MLLM рассуждать с Spatio-Temпоральным аудиовидеом в длинных видео?

#Видео #Может #MLLM #Spatio-Temпоральным #Annualce

arXiv:2609.17248v1 Annualce Type: New Humber Abstract: Multilateral Bigl Language Models продемонстрировали впечатляющее видеопонимание, однако их способность рассуждать над долгоформатными рассказами часто маскируется визуально-центрическими оценками и неэффективной обработкой контекстов. Существующие контрольные показатели слишком сильно касаются визуальной эвристики при маргинализации слуховых сигналов, фактически сокращая модели до "тихих наблюдателей", которые не учитывают реальные межрезонансные рассуждения. Кроме того, стандартный плотный отбор проб создает компромисс между доказательствами и контекстами: расширение рамок для сбора доказательств неизбежно приводит к отвлечению внимания и символическому взрыву. Для того чтобы преодолеть эти пробелы, мы представляем видео-HolmesV2, новый эталонный показатель для Deep Audio Visual Couping. В отличие от предыдущих работ она обеспечивает проведение оценки на основе фактических данных, требуя, чтобы модели обосновывали ответы точными спектрально-временными аудиовизуальными доказательствами и тем самым уменьшали смешанные последствия догадок и галлюцинированных доказательств. В поддержку этого мы представляем: 1) много-

Компьютерная наука > Компютерное видение и распознавание шаблона [представлено 15 сентября 2026 года] Название: Video-HolmesV2: Может ли МЛМ разумиться с Spatio-Temoral Audio-Visual свидетельства в длинных видео? Вид HTML (экспериментальный) Резюме: Мультимодальные модели Большого языка продемонстрировали впечатляющее видеопонимание, однако их способность рассуждать над долгоформатными описаниями часто маскируется визуально-центрическими оценками и неэффективной обработкой контекстов. Существующие контрольные показатели слишком сильно касаются визуальной эвристики при маргинализации слуховых сигналов, фактически сокращая модели до "тихих наблюдателей", которые не учитывают реальные межрезонансные рассуждения. Кроме того, стандартный плотный отбор проб создает компромисс между доказательствами и контекстами: расширение рамок для сбора доказательств неизбежно приводит к отвлечению внимания и символическому взрыву. Для того чтобы преодолеть эти пробелы, мы представляем видео-HolmesV2, новый эталонный показатель для Deep Audio Visual Couping. В отличие от предыдущих работ она обеспечивает проведение оценки на основе фактических данных, требуя, чтобы модели обосновывали ответы точными спектрально-временными аудиовизуальными доказательствами и тем самым уменьшали смешанные последствия догадок и галлюцинированных доказательств. В поддержку этого мы введем: 1) многотиповый межконвертационный трубопровод для обеспечения окоченения задач; 2) Спатиовременный метрик с доказательствами…