Рассуждать с поколениями изображений

#Рассуждать #Annualte #Type #Humber #Briew

arXiv: 2609.16409v1 Annualte Type: New Humber Briew: School-survey (новое резюме): Обдуманная цепочка расшифровок революционизировала естественной языковой процесс, позволив крупным языковым моделям разложить проблемы на промежуточные этапы перед ответом. Однако ограничение аргументации текстовой сферой ограничивает задачи, требующие прямого манипулирования визуальными изображениями. В последнее время усилия по расширению МЛМ с помощью внешних визуальных инструментов, таких как модули оценки глубины или обнаружения объектов, по-прежнему в значительной степени ограничиваются их зависимостью от узких и жестких операций, которые не могут гибко генерировать или преобразовывать визуальное содержание. Мы предлагаем ReImaGin, который использует модели создания изображений в качестве гибкого визуального аргументационного механизма для мультимодальных МЛМ: в отличие от инструментов с фиксированной функцией они принимают естественные языковые команды и могут выполнять открытые визуальные операции, например удалять оккулирование или генерировать план пола из нескольких диспропорций в помещении. В шести различных зрительных аргументах

Компьютерные науки > Комплектное видение и распознавание шаблонов [представлено 14 сентября 2026 года] Название: " Уточнение с изображением поколения PDF HTML (экспериментальное) резюме: разумная аргументация революционизировала естественное языковое обработка, позволив крупным языковым моделям разложить проблемы на промежуточный этап перед ответом. Однако ограничение аргументации текстовой сферой ограничивает задачи, требующие прямого манипулирования визуальными изображениями. В последнее время усилия по расширению МЛМ с помощью внешних визуальных инструментов, таких как модули оценки глубины или обнаружения объектов, по-прежнему в значительной степени ограничиваются их зависимостью от узких и жестких операций, которые не могут гибко генерировать или преобразовывать визуальное содержание. Мы предлагаем ReImaGin, который использует модели создания изображений в качестве гибкого визуального аргументационного механизма для мультимодальных МЛМ: в отличие от инструментов с фиксированной функцией они принимают естественные языковые команды и могут выполнять открытые визуальные операции, например удалять оккулирование или генерировать план пола из нескольких диспропорций в помещении. В рамках шести разнообразных задач визуального обоснования, включая пространственное обоснование с использованием нескольких просмотров и прогнозирование столкновений, " Реймагин > постоянно опережает как текстовые рассуждения, так и исходные параметры специализированных инструментов…