Компьютерные науки > Компютерное видение и распознавание шаблонов [представлено 1 октября 2026 года] Название: SLVR: Структурированная слатентная визуальная рассудка через образ человека, подражающий разумению потоков PDF HTML (экспериментальный) резюме: модели мультимодального большого языка (MLMs) часто отвечают на вопросы визуального обоснования, полагаясь не на зрительные доказательства, а на языковые приводы. Логическая цепочка мышления может частично смягчить этот вопрос, поощряя модели разложить визуальные вопросы на промежуточный этап поиска доказательств, но генерируя эти шаги авторегрессивно увеличивая затраты. Скрытые рассуждения избегают явной логики, однако существующие подходы обеспечивают ограниченный контроль над тем, что кодируют промежуточные штаты, затрудняя осуществление отдельного надзора за планированием, обработкой и отбором доказательств. Мы предлагаем Структурированную визуальную разумность (SLVR) — систему подготовки кадров, которая соединяет четкую цепочку мышления и латентные рассуждения путем организации мультимодальных рассуждений на отпечатанных скрытых этапах планирования, застройки, отбора доказательств и интеграции аргументации. SLVR сначала тренирует модель, чтобы опираться на изображение, маскируя текст для получения ответов и сопоставляя правильный ответ с визуально правдоподобными отвлечениями. Затем он организует рассуждения на скрытых этапах планирования, застройки, отбора доказательств и интеграции, наблюдая каждый этап с…
SLVR: Структурированная скрытая визуальная резонация через человека-потоки
arXiv: 2610.10.10563v1 Annuate Type: New Habrial: Multilateral models music languages (MLMS) часто отвечает на вопросы визуального обоснования, полагаясь не на зрительные доказательства, а на языковые приводы. Логическая цепочка мышления может частично смягчить этот вопрос, поощряя модели разложить визуальные вопросы на промежуточный этап поиска доказательств, но генерируя эти шаги авторегрессивно увеличивая затраты. Скрытые рассуждения избегают явной логики, однако существующие подходы обеспечивают ограниченный контроль над тем, что кодируют промежуточные штаты, затрудняя осуществление отдельного надзора за планированием, обработкой и отбором доказательств. Мы предлагаем Структурированную визуальную разумность (SLVR) — систему подготовки кадров, которая соединяет четкую цепочку мышления и латентные рассуждения путем организации мультимодальных рассуждений на отпечатанных скрытых этапах планирования, застройки, отбора доказательств и интеграции аргументации. СОЛВР сначала обучает модель, чтобы полагаться на изображение мамы