Компьютерные науки > Компютерное видение и распознавание шаблонов [представлен 30 января 2026 (v1), последний пересмотренный вариант 8 сентября 2026 года (эта версия, v4)] Название: TimeBlind: A Spatio-Temпорal Compility Basic for Video LMS View PDF HTML (экспериментальное) резюме: Fine-зернистый анализ времени имеет важное значение для видеосознания и воплощения в себе ИИ. Тем не менее, хотя мультимодальные модели Большого языка (MLMS) являются главными статическими семантиками, их понимание временной динамики остается хрупким. Мы представляем TimeBlind, диагностический критерий для пространственно-временного понимания. Вдохновленный когнитивной наукой, TimeBlind классифицирует тонкозернистые временные понимания на три уровня: распознавание атомных явлений, характеристика свойств событий и рассуждения о взаимозависимости событий. В отличие от контрольных показателей, которые сочетают распознавание с временной аргументацией, TimeBlind использует минимально-паровую парадигму: видео пары имеют идентичное статическое визуальное содержание, но различаются только по временнóй структуре, используя дополнительные вопросы для нейтрализации языковых предпочтений. Оценка более 20 самых современных МЛТ (например, ГПТ-5, Гемини 3 ПРО) по 600 курируемым случаям (2400 видеовопросов), свидетельствует о том, что точность (и правильно различимость обоих видеороликов в паре) является лишь 48,2% от лучших результатов МЛМ, что намного ниже показателей жизни человека (98,2%). Эти результаты…
Временно-временный контрольный параметр состава видео LMS
arXiv:26000288v4 Анонимный тип: заменить резюме: тонкозернистые пространственно-временные понимания необходимы для видеосознания и воплощения ИИ. Тем не менее, хотя мультимодальные модели Большого языка (MLMS) являются главными статическими семантиками, их понимание временной динамики остается хрупким. Мы представляем TimeBlind, диагностический критерий для пространственно-временного понимания. Вдохновленный когнитивной наукой, TimeBlind классифицирует тонкозернистые временные понимания на три уровня: распознавание атомных явлений, характеристика свойств событий и рассуждения о взаимозависимости событий. В отличие от контрольных показателей, которые сочетают распознавание с временной аргументацией, TimeBlind использует минимально-паровую парадигму: видео пары имеют идентичное статическое визуальное содержание, но различаются только по временнóй структуре, используя дополнительные вопросы для нейтрализации языковых предпочтений. Оценка более чем 20 современных МЛЛМ (например, ГПТ-5, " Джемини-3 ПРО &qt; ) по 600 курируемым случаям (2400 пар видеовопросов), свидетельствует о том, что случай