Дорожка, искусство, акт: создание рисунков из видеоаудиозаписи случайных людей

#Дорожка #Annualce #Type #Human #Videos

arXiv:2609.191199v1 Annualce Type: New Human Videos содержит богатое причинно-следственное доказательство для манипуляции роботом: они показывают, как движение руки вызывает движения объекта и производят изменения в объектном состоянии. В этой работе мы изучаем сочлененные предметы, такие как двери, ящики, шкафы, ноутбуки, духовки и навесные контейнеры, которые повсеместно присутствуют в повседневной жизни и создают уникальные проблемы для воплощаемого взаимодействия. Эти объекты не могут быть представлены одной позой; их движение зависит от основных частей и суставов. Мы введем реальные рамки, которые реконструируют готовый к имитации симулятивный объект и взаимодействие вручную из обычного монокулярного RGB видео без ввода RGB-D или мультивидения, предварительного сканирования, ручных суставов или демонстрации роботом. Наша основная точка зрения заключается в том, что плотные 3D-треки обеспечивают воплощение агностического созвучного сигнала: точки на фиксированной линии остаются приблизительно неподвижными, а точки на подвижном звене следуют за последовательной революцией или

Компьютерная наука > Компютерное видение и распознавание шаблонов [представлено 16 сентября 2026 года] Название: Track, Articulate, Act: Выработка рисунков из Casual Human Videos View PDF HTML (экспериментальное) Резюме: В видео человека содержится множество причинно-следственных доказательств для манипуляций роботами: они показывают, как движение рук вызывает движения объекта и производят изменения в объекте. В этой работе мы изучаем сочлененные предметы, такие как двери, ящики, шкафы, ноутбуки, духовки и навесные контейнеры, которые повсеместно присутствуют в повседневной жизни и создают уникальные проблемы для воплощаемого взаимодействия. Эти объекты не могут быть представлены одной позой; их движение зависит от основных частей и суставов. Мы введем реальные рамки, которые реконструируют готовый к имитации симулятивный объект и взаимодействие вручную из обычного монокулярного RGB видео без ввода RGB-D или мультивидения, предварительного сканирования, ручных суставов или демонстрации роботом. Наша основная точка зрения заключается в том, что плотные 3D-треки дают воплощение агностического созвучного сигнала: точки на фиксированной связи остаются приблизительно неподвижными, а точки на подвижном звене следуют за последовательным революционным или призматическим движением. Наш метод распределяет связи, оценивает сустав и траекторию состояния, восстанавливает сочлененный актив и приводит найденное 3D движение руки в соответствие с объектом. Центральное место в нашем подходе…