Пространственное скруживание для 3D Visual Ground:
arXiv: 2606,31148v2 Adminus Type: заменить кросс-бюллетень: 3D Visual Grauning (3DVG) имеет целью локализовать объекты в 3D сценах при естественном описании языка. Существующие подходы, как правило, позволяют анализировать всю картину, что приводит к двусмысленным прогнозам и высоким вычислительным затратам, особенно в разбитой среде. Мы отмечаем, что многие преференциальные выражения основываются на местном пространственном контексте и зачастую соответствуют ограниченным пространственным регионам, а не полной сцене. Исходя из этого понимания, мы предлагаем ПрюнГраунд — эффективную систему вставки и игры для 3DVG, построенную на трех ключевых компонентах. Во-первых, мы введем языковое пространственное скручение (LGSP), которое позволяет использовать замороженную модель языка зрения (VLM) для выявления регионов, имеющих отношение к языку, что сокращает пространственный расчет и заземление кандидатов в более узком пространстве поиска. Во-вторых, мы предлагаем переформулировать описание (MCDR), в котором сложные выражения делятся на упрощенные цели.