Двойная память для обоснования видения

#Двойная #Annualce #Type #Humber #Abstract

arXiv: 2609.05539v1 Annualce Type: New Humber Abstract: Multilateral models majoring languages (MLMs) недавно добились значительного прогресса в рассуждении о языке зрения, однако их эффективность часто ухудшается по мере увеличения поколений. Один из ключевых факторов заключается в том, что они часто теряют следы ранее полученных визуальных данных и промежуточных ограничений в условиях монолитного роста. Вдохновляемые тем, как люди по отдельности помнят то, что они видят и что они делают при решении сложных задач, мы предлагаем DLMR — эффективный с точки зрения параметров механизм, который оснащает MLLM двойными латентными воспоминаниями: визуальные воспоминания, которые компримируют доказательства изображений и аргументационную память, которая отслеживает промежуточные выводы и ограничения. Затем Rainer динамическо решает, какую память и сколько можно использовать в процессе вывода, сохраняя визуальный заземление при сохранении последовательной долго-горизонтной аргументации. ДЛМР проходит обучение в три этапа: от скрытых построек памяти до выборочного обучения маршрутизатора, сохраняя при этом замороженную основу MLM, что дает значительную га

Компьютерные науки > Компютерное видение и распознавание моделей [представлено 2 сентября 2026 года] Название: Dual-Latent Memory Routing for Vision - Language Разумный взгляд на HTML (экспериментальный) резюме: модели мультимодального большого языка (MLMs) недавно добились значительного прогресса в рассуждении о языке зрения, однако их эффективность зачастую ухудшается по мере роста поколений. Один из ключевых факторов заключается в том, что они часто теряют следы ранее полученных визуальных данных и промежуточных ограничений в условиях монолитного роста. Вдохновляемые тем, как люди по отдельности помнят то, что они видят и что они делают при решении сложных задач, мы предлагаем DLMR — эффективный с точки зрения параметров механизм, который оснащает MLLM двойными латентными воспоминаниями: визуальные воспоминания, которые компримируют доказательства изображений и аргументационную память, которая отслеживает промежуточные выводы и ограничения. Затем Rainer динамическо решает, какую память и сколько можно использовать в процессе вывода, сохраняя визуальный заземление при сохранении последовательной долго-горизонтной аргументации. ДЛМР проходит подготовку в три этапа: от скрытых запоминаний до выборочного обучения маршрутизатора, сохраняя при этом замороженную основу MLLM, что дает значительный выигрыш как по общим, так и по логическим контрольным параметрам лишь при небольшом количестве дополнительных поддающихся обучению параметров. Кроме того, анализ показывает…