ClassTrap: Управленческие чумы в изображениях сдвигают решения VLM, несмотря на четкие инструкции игнорировать их

#ClassTrap #Управленческие #Annualce #Type #Brieful

arXiv: 26009,06058v1 Annualce Type: New Brieful: По мере того, как модели на языке зрения (VLM) становятся все более способными и используются в соответствующих реальных условиях мира, они должны оценивать доказательства независимо, а не без критиков откладывать их до власти человека. Мы введем систему ClassTrap, контролируемую оценку, которая ставит два социальных сигнала в прямой конфликт: ответ студентов, который должен привлечь сикофантское согласие, и противоречивый ответ, приписываемый ровеснику, учителю или официальному ключу ответа, что должно привлекать авторитетное уважение. Модели дают бесплатные ответы, но при этом им четко даны указания решать их независимо и игнорировать все ответы учащихся, отзывы и оценки. Мы проверяем модели на 60 сценариях синтетического реального мира. Пять нейтральных испытаний позволяют установить стабильное отношение к модели, за которым следуют три повторяющихся экспериментальных сигнала, включая контроль. На 45-значном общем перекрестке через Гемини 3.5 Flash Lite, GPT-5.6 Луна и Клод Хайку 4.

Компьютерные науки > Компютерное видение и распознавание шаблонов [представлено 5 сентября 2026 года] Название: ГрадеТрапа: "Управляющие кусы в смене образа VLM решения, несмотря на эксплицитные инструкции для Ignore Them View PDF HTML (экспериментальное) резюме: По мере того как модели на языке зрения (VLM) становятся все более пригодными и применяются в соответствующих реальных условиях мира, они должны оценивать доказательства независимо, а не без критики откладывать их до авторитета человека. Мы введем систему ClassTrap, контролируемую оценку, которая ставит два социальных сигнала в прямой конфликт: ответ студентов, который должен привлечь сикофантское согласие, и противоречивый ответ, приписываемый ровеснику, учителю или официальному ключу ответа, что должно привлекать авторитетное уважение. Модели дают бесплатные ответы, но при этом им четко даны указания решать их независимо и игнорировать все ответы учащихся, отзывы и оценки. Мы проверяем модели на 60 сценариях синтетического реального мира. Пять нейтральных испытаний позволяют установить стабильное отношение к модели, за которым следуют три повторяющихся экспериментальных сигнала, включая контроль. На 45-пункте общего пересечения через Гемини 3.5 Flash Lite, GPT-5.6 Луна и Клод Хайку 4.5 общий контроль за вторым ответом дает 5,4% противоречивых ответов. По отношению к этому контролю объединенные изменения в рамках отдельных элементов не дают надежного эффекта коллегиального обзора, эффекта 6,9 балла для оценки…