Пространственный блок: укрепление пространственной разведки в LVLM через проблему синтетического блока-постановки

#Пространственный #LVLM #Annuate #Type #Humber

arXiv: 26009,07064v1 Annuate Type: New Humber: Bigal Vision-Language Models (LLVMS) достигли высоких результатов в различных визуальных задачах, однако их способность к восстановлению и обоснованию 3D структуры сцены, изображенной на 2D изображениях -- так называемой пространственной информации -- остается ограниченной. Существующие подходы направлены на устранение этого пробела путем использования пространственных вопросов в реальном слое данных, которые требуют плотных геометрических аннотаций. Вместе с тем создание таких знаков сопряжено со значительными расходами, занимает много времени и зачастую шумит из-за опоры на внешние модули восприятия. В этой работе мы предлагаем новую парадигму, основанную на когнитивном развитии человека: обучение фундаментальным пространственным навыкам с помощью структурированных задач по управлению блоком. Мы введем SpaceBlock-15k, синтетическое набор данных из 15 000 проблем блок-стагинга, охватывающих проекцию от 3D до 2D, трансформацию точки зрения и структурную комбинацию. Набор данных включает также контролируемую цветовую модуляцию в качестве визуальных сигналов для поощрения