ОВЭР: Токенирование на основе охвата для мультивидной 3D-смазки в УЗМ

#ОВЭР #Токенирование #Annuate #Type #Hightreat

arXiv: 26009,08345v1 Annuate Type: New Hightreat: Презентация 3D-сцены как многовидовые изображения позволяет 2D VLM рассуждать в 3D путем повторного использования приводов от предварительной подготовки, ограждая дефицит аннотированных 3D данных. Однако она производит тысячи ненужных визуальных символов, стоимость которых растет с каждым взглядом. Существующие зрительные символические сливки распадаются на две семьи, каждая из которых ограничена в 3D мультивидении. Извлеченные методы оценки важности ранжируют символы с помощью внимания или энкодерных характеристик; поскольку избыточность здесь по сути носит пространственный характер, они сохраняют почти двойные символы из нескольких известных регионов и оставляют большую часть непредставленной картины. Методы фокселизации расширяют пространственный охват, но не могут обеспечить точный символический бюджет и сатурат по мере того, как многовидовые наблюдения перекрываются в 3D, что значительно ниже целевого показателя. Мы показываем, что пространственный охват связан с 3D-стимулирующими показателями и введем coVeR — детерминистский, бестренировочный переключатель, использующий только символические координаты без усвоенных сигналов