Разъяснение причин многовидового пространственного понимания
arXiv: 2610.11810v1 Annuales Type: New Express: Существующие подходы к пространственному рассуждению с многовидным видом в значительной степени основаны на слабом взгляде на вводимую информацию. Таким образом, модели языка зрения (МВУ) ограничиваются пониманием сцены и определением пространственных отношений в рамках этих фиксированных взглядов, что приводит к хрупкому переплетению между видом и узкому уголку геометрии на язык. Для решения этих вопросов мы формулируем новый подход к рассуждению поиска и оценки, с тем чтобы найти подразумеваемые пространственные доказательства перекрестного обзора путем определения отношения к вопросу в поддержку пространственного обоснования. Для реализации этого подхода мы предлагаем создать бесподготовочную модель агностического рассуждения, которая сочетает VLM с 3D-базовой моделью: логическую стадию для анализа вопросов и планирования просмотра, за которой следует этап увеличения доказательств на основе геометрии в целях эффективного синтезирования и включения визуальных данных в окончательную аргументацию. Всеобъемлющие эксперименты на шести МВУ свидетельствуют о последовательном улучшении пяти контрольных показателей су