VideoScout: Учёба агентского активного исследования с адаптивным расчетом на долгое видеопонимание
arXiv:2609.15606v1 Annuate Type: New Habstractive: Multildom Bigh Language Models (MLMs) добились замечательных успехов в плане краткого видеопонимания, но по-прежнему ограничены длинными видеозаписями ввиду ограниченности окна визуального контекста. Преобладающие подходы основываются на единообразном отборе проб рамы или недавнем резком агенто-измерении, оба из которых борются с локализацией скудных и важных доказательств в достаточно длинных видеозаписях. Мы формулируем длинное видеопонимание как проблему intextbf {Sequential Data Accessing (SEA)}, в которой агент читает видео поворачивается по временной оси, решая на каждом повороте, насколько быстро смотреть, какие доказательства сохранить, когда возвращаться к неопределенным сегментам и когда остановиться и ответить. Вдохновленные этим мнением, мы предлагаем /textbf {VideoScout} — многооборотный аргументационный агент, который подталкивает парадигму СЭО к адаптивным рассуждениям. Если говорить конкретно, то благодаря динамическому контролю за скоростью просмотра VideoScout позволяет эффективно пересечь длинные видео в пределах ограниченного v