Реклама

Модели большого языка в качестве классификаторов изображений

#Модели #Исследования #ММЛМ #Оценка #ReGT

arXiv:2603.06578v3 Тип уведомления: заменить резюме: эффективность классификации мультимодальной модели большого языка (MLM) в решающей степени зависит от протокола оценки и качества наземной истины. Исследования, проведенные в целях сопоставления ММЛМ с контролируемыми моделями и моделями зрения-лангуага (МВУ), свидетельствуют о наличии противоречивых выводов, и мы показываем, что эти конфликты вытекают из протоколов, которые либо накачивают, либо недооценивают эффективность. В рамках наиболее распространенных протоколов оценки мы выявляем и устраняем ключевые вопросы: результаты модели, которые выходят за рамки представленного списка классов и отклоняются, завышенные результаты в результате слабых многорежимных отвлекающих устройств, а также условия открытого мира, которые не дают результатов только из-за плохого картирования выпуска. Кроме того, мы количественно оцениваем влияние обычно игнорируемых вариантов дизайна: размер партии, заказ изображения и выбор текстового конструктора — показав, что они существенно влияют на точность. Оценка ReGT, наша многомаркированная реаннотация 625 классов ImageNet-1k показывает, что MLLM больше всего выигрывает от исправленных знаков (до +10,8%), субс