Компьютерные науки > Компютерное видение и распознавание моделей [представлено 15 сентября 2026 года] Название: SAVOR: Самозащитная визуальный подземка с помощью калибрированного укрепления обучения мультимодальным галлюцинациям, взгляд PDF HTML (экспериментальное) резюме: Мультимодифицированные модели больших языков (MLMs) добились значительного прогресса в визуальном ответе на вопросы и надписях изображения, однако они по-прежнему создают свободно обоснованные претензии на объекты, атрибуты или отношения, которые не основаны на имидже. Многие средства либо модифицируют декодирование во время теста, что добавляет латентность, или тонкую строку таких предпочтений, как варианты DPO, которые учат какой ответ предпочтительным, но не когда собственный ответ модели является ненадежным. Мы считаем, что калиброванная самооценка - это недостающий сигнал. Мы введем систему подготовки, которая i) повышает уровень достоверности схемы выпуска с помощью символов и ответов; ii) оптимизирует политику с целью оптимизации политики группы (ГРПО), предусматривающей наказание за ошибки при калибровке и неудовлетворительное принятие решений о воздержании; и iii) использует полученную уверенность во время вывода для повторного рассмотрения визуальных доказательств только тогда, когда модель является неопределенной. Эксперименты на ПОП, Халублибенч, АМБЕР и MMHAL-Bench по двум последним позвоночнику (InternVL3-8B и Qwen3-VL-8B) показывают, что Savor сокращает галлюцинации при сохранении общей…
SAVOR: Самосознательная визуальные заземления с помощью клинического укрепления доверия в целях смягчения последствий смешанных галлюцинаций
arXiv: 2609.16601v1 Annuales Type: New Humber Abstract: Multilateral models majors (MLMs) добились значительного прогресса в визуальном ответе на вопросы и надписи изображения, однако они по-прежнему дают свободно заявления об объектах, атрибутах или отношениях, которые не основаны на имидже. Многие средства либо модифицируют декодирование во время теста, что добавляет латентность, или тонкую строку таких предпочтений, как варианты DPO, которые учат какой ответ предпочтительным, но не когда собственный ответ модели является ненадежным. Мы считаем, что калиброванная самооценка - это недостающий сигнал. Мы введем систему подготовки, которая i) повышает уровень достоверности схемы выпуска с помощью символов и ответов; ii) оптимизирует политику с целью оптимизации политики группы (ГРПО), предусматривающей наказание за ошибки при калибровке и неудовлетворительное принятие решений о воздержании; и iii) использует полученную уверенность во время вывода для повторного рассмотрения визуальных доказательств только тогда, когда модель является неопределенной. Эксперименты на ПОПЕ, Халулибэнч, АМБЕР и MMHal-Bench через tw