Активная шкала: расширение активного восприятия роботов с помощью моделей, данных и аппаратных средств

#Активная #Annuate #Type #Активное #ActiveScale

arXiv: 2609.18514v1 Annuate Type: кросс-бюллетень: Активное восприятие имеет важное значение для роботоманизации, когда фиксированные точки зрения оставляют информацию, имеющую отношение к задаче, закрытой или ненаблюдаемой. Однако создание возможностей для того, чтобы модели на языке зрения (VLA) могли анализировать меняющиеся точки зрения и активно получать информативные наблюдения, по-прежнему сопряжено с трудностями. Мы представляем ActiveScale, рамки, которые способствуют активному восприятию с помощью скоординированной модели, данных и аппаратных средств. Наша модель дополняет VLA историческими видеонаблюдениями и прямым наблюдением с камерой, используя символы на каждой фрейме и легкого прогнозируемого человека для увязки наблюдений между точками зрения и содействия последовательному пониманию места. Чтобы извлечь уроки из движения камеры, естественно присутствующей в человеческой деятельности, мы вводим масштабируемый рецепт человека-робота среднего тренировки с использованием 1000 часов эгоцентрических и роботизированных данных, адаптируя модель к временным входным данным и создавая наблюдение. Мы далее представляем Mobile Integration-Mobel

Компьютерные науки > Робототехника [представлен 16 сентября 2026 года] Название: Активная Шкала: Расширение активного восприятия роботов по всей модели, данным и внешности PDF HTML (экспериментальное) резюме: Активное восприятие имеет важное значение для роботной манипуляции, когда фиксированные точки зрения оставляют закупоренную или ненаблюдаемую информацию. Однако создание возможностей для того, чтобы модели на языке зрения (VLA) могли анализировать меняющиеся точки зрения и активно получать информативные наблюдения, по-прежнему сопряжено с трудностями. Мы представляем ActiveScale, рамки, которые способствуют активному восприятию с помощью скоординированной модели, данных и аппаратных средств. Наша модель дополняет VLA историческими видеонаблюдениями и прямым наблюдением с камерой, используя символы на каждой фрейме и легкого прогнозируемого человека для увязки наблюдений между точками зрения и содействия последовательному пониманию места. Чтобы извлечь уроки из движения камеры, естественно присутствующей в человеческой деятельности, мы вводим масштабируемый рецепт человека-робота среднего тренировки с использованием 1000 часов эгоцентрических и роботизированных данных, адаптируя модель к временным входным данным и создавая наблюдение. Мы далее введем в действие платформу активного восприятия мобильного управления (AMP), роботную платформу, которая поддерживает активное восприятие и мобильных манипуляций с помощью телесотрудничества одного оператора, что позволяет…