Реклама

Обратно-LLAVA: Переосмысление мультимодального согласования на основе картирования с использованием текстовых сообщений

#Обратно-LLAVA #Переосмысление #Annuales #Type #Подключение

arXiv: 25008.12466v3 Annuales Type: заменить резюме: Подключение заранее подготовленного зрения и языковых моделей обычно предполагает проецирование функций изображения в входном пространстве модели. Обратно-LLAVA переворачивает это картирование в поле внимания декодера: языковые состояния проецируются на размер визуальной функции, а карты конкретного вида дают остаточный запрос, ключ и обновление стоимости. Взрыв и адаптация на низком уровне (LoRA) совместно обучаются из 665K визуальных инструкций с замороженными позвоночниками без отдельной стадии регулировки. В рамках девяти основных базовых оценок окончательная модель 7В подходит к двум этапам LLaVA-1.5 по нескольким задачам. Набирал 78,45% на VQAv2 против 79,13% для официального LLaVA-LoRA и 50,96% против 48,56% на BizWiz; TextVQA ниже 56,96 % по сравнению с 58,47 %. В контролируемых исследованиях изучаются компоненты синтеза, глубина ввода, визуальные характеристики и размер языковой модели. Анализ представительства показывает, что в текстах сохраняется большая часть парных сходств при изменении их геев

Компьютерная наука > Компютерное видение и распознавание моделей [представлено 17 августа 2025 года (v1), последний раз пересмотрен 8 октября 2026 года (эта версия, v3)] Название: Inver-LAVa: Переработка мультимодальных решений через Text-Vision School View PDF HTML (экспериментальное) резюме: Сознавая заранее подготовленные взгляды и языковые модели обычно предполагает проецирование характеристик изображения в входном пространстве языковой модели. Обратно-LLAVA переворачивает это картирование в поле внимания декодера: языковые состояния проецируются на размер визуальной функции, а карты конкретного вида дают остаточный запрос, ключ и обновление стоимости. Взрыв и адаптация на низком уровне (LoRA) совместно обучаются из 665K визуальных инструкций с замороженными позвоночниками без отдельной стадии регулировки. В рамках девяти основных базовых оценок окончательная модель 7В подходит к двум этапам LLaVA-1.5 по нескольким задачам. Набирал 78,45% на VQAv2 против 79,13% для официального LLaVA-LoRA и 50,96% против 48,56% на BizWiz; TextVQA ниже 56,96 % по сравнению с 58,47 %. В контролируемых исследованиях изучаются компоненты синтеза, глубина ввода, визуальные характеристики и размер языковой модели. Анализ представленности показывает, что в текстах сохранена большая часть парных сходств при изменении их геометрического распределения. Дополнительный парный надзор улучшит распознавание знаменитостей, в то время как инструкции перепроигрывают ремонтные ошибки с помощью…