DVD: Динамическая декодация векторов для эффективного восприятия на основе MLLM
arXiv:2610.12266v1 Annuales Type: New Habstrate: Multildom music language Models добились замечательных успехов в деле увязки видения и языка, облегчая различные задачи восприятия, необходимые для взаимодействия человека с автоматом, робототехники и автономного вождения. Вместе с тем существующие методы восприятия, основанные на MLLM, в основном основываются на текстовом отображении координат, которое страдает от чрезмерных символических надписей или квантизации фиксированной дальности, которые страдают из-за ограничений диапазона и точности, особенно для 3D областей с неограниченным пространственным диапазоном и высоким уровнем точности локализации. Для решения этих задач мы предлагаем метод динамического декодирования вектора DVD, который объединяет задачи 2D и 3D восприятия. Если говорить конкретно, то мы сначала преобразуем различные модели восприятия (т.е. 2D-консолидирующие коробки, 2D маски и 3D-ограничители) в последовательности 1D векторов, которые затем картируются для уплотнения дискретных символов в высокомерном пространстве. Затем, легкий токени