Обзор 3D моделей зрения-лангуажа

#Обзор #Видеотипы #CLIP

arXiv: 2609.05583v1 Видеотипы (VLM) изменяют компьютерное зрение путем согласования визуальных и текстовых встроенных устройств, позволяя моделям распознавать визуальные концепции и рассуждать о них с использованием естественного языка. Однако традиционные модели 3D глубокого обучения обычно обучаются для выполнения конкретных задач, таких как классификация, сегментация или обнаружение, и они не обеспечивают естественного перекрестного поиска информации из их встроенных помещений с использованием текста или изображений в качестве запросов. Для решения этой проблемы методы предподготовки на основе противоречивого языка (CLIP) увязывают 3D-приобретения с заранее подготовленными изображениями и текстовыми представлениями, что приводит к созданию 3D моделей зрения-лангуажа (3D VLM), которые поддерживают классификацию безоткатных форм, перекрестный поиск и открытое распознавание трехмерной формы. В этом учебном документе содержится обзор трехмерных НДЖ, начиная с основных определений 3D-образий и их кодирования в привязки к интермодальным контрастным соединениям, современной мультимодальной системы

Компьютерная наука > Компютерное видение и распознавание шаблонов [представлено 4 сентября 2026 года] Название: Обзор 3D моделей зрения - Language View PDF HTML (экспериментальный) Резюме: Vision-Language Models (VLMs) меняет компьютерное зрение путем согласования визуальных и текстовых встроенных устройств, позволяя моделям признавать визуальные концепции и разумы о них с использованием естественного языка. Однако традиционные модели 3D глубокого обучения обычно обучаются для выполнения конкретных задач, таких как классификация, сегментация или обнаружение, и они не обеспечивают естественного перекрестного поиска информации из их встроенных помещений с использованием текста или изображений в качестве запросов. Для решения этой проблемы методы предподготовки на основе противоречивого языка (CLIP) увязывают 3D-приобретения с заранее подготовленными изображениями и текстовыми представлениями, что приводит к созданию 3D моделей зрения-лангуажа (3D VLM), которые поддерживают классификацию безоткатных форм, перекрестный поиск и открытое распознавание трехмерной формы. В этом учебном заведении содержится обзор трехмерных НДЖ, начиная с базовых определений 3D-представителей и их кодирования в привязке к интермодальным контрастным соединениям, современных смешанных систем и моделей 3D зрения-крупного языка (3D VLLM). Мы представляем основные определения контрастного обучения для мультимодального привязки и обращаем внимание на последние достижения в 3D-голосовском сплате, 3D…