VideoM: Адаптивные макро-микросхемы для эффективного видео MLLM

#VideoM #Адаптивные #MLLM #Annuate #Type

arXiv: 2609.16722v1 Annuate Type: кросс-бюллетень: расширение мультимодальных моделей большого языка (MLMs) до долгосрочного видеопонимания затуманено взрывом визуальных символов, которые сатурируют окна контекста и несут непомерные расходы. Нынешние решения в основном опираются на вспомогательные модели для символического сокращения, но сталкиваются с фундаментальной дилеммой: подходы, основанные на использовании легковесных энкодеров, часто не учитывают критическую семантичную информацию, тогда как сокращение выбросов MLM, обусловленное тяжелым весом, сводит на нет повышение эффективности. {В этой работе мы выявляем более основополагающую неэффективность, лежащую в основе этой дилеммы: хотя тонкозернистые визуальные детали имеют важное значение для детального понимания, они во многом являются излишними при выполнении предварительной задачи выбора регионов, имеющих отношение к семанту.} Мотивируемыми этим, мы вводим /текстбf {VideoM}, что знаменует собой переход парадигмы от искусственно-центричного сокращения к адаптивной перцептурной гранулярности. В частности, наши рамки {отделяют выбор от рассуждений} путем выполнения семантического

Компьютерная наука > Искусственный интеллект [представлен 15 сентября 2026 года] Название: VideoMM: Adventionive Macro-Micro Force for Effective Videople MLLM View PDF HTML (экспериментальный) Резюме: Совершенствование мультимодальных моделей Большого языка (MLMS) до долгосрочного понимания видеозаписей является запятнанным взрывом визуальных символов, которые сатурируют окна контекста и несут непомерные расходы. Нынешние решения в основном опираются на вспомогательные модели для символического сокращения, но сталкиваются с фундаментальной дилеммой: подходы, основанные на использовании легковесных энкодеров, часто не учитывают критическую семантичную информацию, тогда как сокращение выбросов MLM, обусловленное тяжелым весом, сводит на нет повышение эффективности. {В этой работе мы выявляем более основополагающую неэффективность, лежащую в основе этой дилеммы: хотя тонкозернистые визуальные детали имеют важное значение для детального понимания, они во многом являются излишними при выполнении предварительной задачи выбора регионов, имеющих отношение к семанту.} Мотивируемыми этим, мы вводим /текстбf {VideoM}, что знаменует собой переход парадигмы от искусственно-центричного сокращения к адаптивной перцептурной гранулярности. В частности, наши рамки {отделяют выбор от рассуждений} путем проведения семантической фильтрации на экономически эффективном /текстите {Macro Proxi} (на основе разрозненных систем) и проецирования выбранных регионов на высокодостоверные \текстит {Микро…