3DWay: Обобщение манипулирования роботом через 3D последовательные пути

#Обобщение #Переформулировав #Прогнозируемые #Обширные

arXiv: 2609.082224v1 Тип уведомления: перекрестное резюме: промежуточные представления являются ключом к преодолению разрыва между политикой общих манипуляций и крупномасштабными предварительно подготовленными моделями языка зрения (ДВУ). Среди них траектории представления в компактном виде отражают сигналы, имеющие отношение к движению, однако большинство существующих подходов предсказывают траектории 2D пространства для изображений, что приводит к неизбежной 3Д двусмысленности. Кроме того, использование двухмерных траекторий с глубиной все еще оставляет неясные точки свободного пространства, ограничивая надежные триD рассуждения. Для решения этой проблемы мы предлагаем прогнозировать 3D последовательные точки (3DWay) из многовидовых изображений. Переформулировав 3D-пороги прогнозирования как генерирующие 2D-уровни мультивидения, за которыми следуют геометрические триангуляции, мы допускаем эксплицитную 3-D спецификацию движения при сохранении сильных предшественников предварительно подготовленных VLM. Прогнозируемые точки могут служить ориентиром для существующих моделей ВЛА в целях более полного обобщения или непосредственного выполнения простых задач. Обширные эксперименты s

Компьютерная наука > Робототехника [представлен 8 сентября 2026 года] Название: 3DWay: Обобщение манипулирования робота с помощью 3D Seconstitution Whooints View PDF HTML (экспериментальное) резюме: Intermediate reports является ключом к преодолению разрыва между модулемной политикой широких манипуляций и крупномасштабными заранее подготовленными моделями языка зрения (VLM). Среди них траектории представления в компактном виде отражают сигналы, имеющие отношение к движению, однако большинство существующих подходов предсказывают траектории 2D пространства для изображений, что приводит к неизбежной 3Д двусмысленности. Кроме того, использование двухмерных траекторий с глубиной все еще оставляет неясные точки свободного пространства, ограничивая надежные триD рассуждения. Для решения этой проблемы мы предлагаем прогнозировать 3D последовательные точки (3DWay) из многовидовых изображений. Переформулировав 3D-пороги прогнозирования как генерирующие 2D-уровни мультивидения, за которыми следуют геометрические триангуляции, мы допускаем эксплицитную 3-D спецификацию движения при сохранении сильных предшественников предварительно подготовленных VLM. Прогнозируемые точки могут служить ориентиром для существующих моделей ВЛА в целях более полного обобщения или непосредственного выполнения простых задач. Обширные эксперименты показывают, что 3DWay значительно улучшает 3-D пространственное заземление и рассуждения на языке зрения, демонстрируя большой потенциал для повсеместного…