Компьютерные науки > Знания и распознавания моделей компьютера [представлены 15 сентября 2026 года] Название: Что можно сказать о галлюцинациях в мультимодальном обосновании? Диагнозирование ошибок в визуальном насаждении с помощью противопоказательного декодирования Пробс Вид PDF HTML (экспериментальное) Резюме: Когда мощные мультимодальные модели широко доступны, для достижения прогресса требуются новые научные методологии, выходящие за рамки контрольных баллов - используемые модели как инструменты понимания поведения. Мы рассматриваем этот вопрос следующим образом: можем ли мы использовать крупные модели языка зрения (LVMS) в качестве экспериментальных инструментов для изучения их собственной динамики сбоев? Сосредоточив внимание на визуальном галлюцинации, мы введем систему бесплатного декодирования SAFE, которая противопоставляет визуальные и просветленные пути поколения для получения контрастного показателя уровня, который определяет, когда модель предпочитает языковые приводы по сравнению с наглядными свидетельствами. Этот сигнал выполняет двойную функцию: он служит практическим опосредованным средством обнаружения визуально ненастроенных символов и основой для декодирования штрафных санкций. Наш анализ позволяет получить три эмпирических наблюдения: зрительная зависимость распадается на протяжении всего поколения, галлюцинации сопутствуют в временных группах и раннее вмешательство уменьшает кластерность без существенного унижений. Что касается MMHalbench, то SAFE…
Что говорят галлюцинации о том, как рассуждать смешанным образом? Диагностика сбоев в визуальном насаждении с помощью противопоказательных декодирующих датчиков
arXiv:2609.16646v1 Анонс: новое резюме: Когда мощные мультимодальные модели широко доступны, для достижения прогресса требуются новые научные методологии, выходящие за рамки контрольных оценок - используемые модели в качестве инструментов понимания поведения. Мы рассматриваем этот вопрос следующим образом: можем ли мы использовать крупные модели языка зрения (LVMS) в качестве экспериментальных инструментов для изучения их собственной динамики сбоев? Сосредоточившись на визуальном галлюцинации, мы введем систему бесплатного декодирования SAFE, которая противопоставляет визуальные и просветленные пути поколения для получения контрастного показателя уровня, который определяет, когда модель предпочитает языковые приводы по сравнению с наглядными свидетельствами. Этот сигнал выполняет двойную функцию: он служит практическим опосредованным средством обнаружения визуально ненастроенных символов и основой для декодирования штрафных санкций. Наш анализ позволяет получить три эмпирических наблюдения: зрительная зависимость распадается на протяжении поколения, галлюцинации сопутствуют во временных кластерах и раннее вмешательство уменьшает кумулятивное воздействие без существенного увеличения.