Компьютерные науки > Компютерное видение и распознавание шаблонов [представлено 5 сентября 2026 года] Название: VDiff-Bench: A Challenging Basic for Line-Grained Image Discrimination PDF THML (экспериментальное) резюме: Multimodal Крупные языковые модели (MLMs) в значительной степени выполняют задачи общего визуального понимания, такие как визуальные ответы на вопросы, однако они часто сталкиваются с базовым сравнительным опытом: выявление того, что изменилось между двумя аналогичными изображениями. Мы введем VDiff-Bench, трудный ориентир многообразного выбора для тонкозернистых идентифицирующих различий. VDiff-Bench содержит 1 756 четырехкомпонентных вопросов по парам изображений и охватывает 10 категорий изменений: положение, движение, цвет регионального изображения, общий цвет изображения, внешний вид/исчезновение, шум/разрешение, текстура, замена/размер, OCR/текст и освещение. Каждый вопрос соответствует двум входным данным изображения с четырьмя вариантами: истинное различие, два жестких отрицательных описания и отвлечение "без разницы". Для того чтобы сделать задачу сложной, мы конкретно закупаем сухожилия, которые требуют моделей для проведения различия между реальными изменениями и близлежащими семантическими альтернативами. Эксперименты с 11 новейшими открытыми и закрытыми ММЛС показывают, что мелкозернистые визуальные сопоставления остаются хрупкими: модели характеризуются неравномерностью показателей по различным источникам и категориям изменений при постоянных…
VDiff-Bench: Противоречный контрольный параметр для идентификации различий в изображениях, полученных с помощью тонкозернистых изображений
arXiv: 2609.06245v1 Annualce Type: New Humber Abstract: Multildary Bigl Language Models (MLMs) хорошо выполняет общие задачи визуального понимания, такие как визуальный ответ на вопросы, но они часто сталкиваются с базовыми сравнительными навыками: выявление того, что изменилось между двумя аналогичными изображениями. Мы введем VDiff-Bench, трудный ориентир многообразного выбора для тонкозернистых идентифицирующих различий. VDiff-Bench содержит 1 756 четырехкомпонентных вопросов по парам изображений и охватывает 10 категорий изменений: положение, движение, цвет регионального изображения, общий цвет изображения, внешний вид/исчезновение, шум/разрешение, текстура, замена/размер, OCR/текст и освещение. Каждый вопрос соответствует двум входным данным изображения с четырьмя вариантами: истинное различие, два жестких отрицательных описания и отвлечение "без разницы". Для того чтобы сделать задачу сложной, мы конкретно закупаем сухожилия, которые требуют моделей для проведения различия между реальными изменениями и близлежащими семантическими альтернативами. Эксперимент