Компьютерные науки > Роботы [представлен 15 сентября 2026 года] Название: " Увидеть то, что важно: Visual Cue Guide Video Planning for Antalizable Robot Watch View PDF HTML (экспериментальное) Резюме: Генеративные видеомодели могут служить перспективной основой для навигации робо-навигации путем прогнозирования будущих наблюдений как видеопланов. Последние подходы часто обусловливают планирование видео с помощью кратко-горизонтного руководства и восстановление геометрических точек посредством реконструкции места событий, в результате чего более долгосрочное планирование и точный перевод видео на действия остаются менее изученными. Мы представляем CueNav, навигационную систему на основе видеомодели, объединяющую визуальное планирование видео с олицетворением модели Обратной Динамики (IDM). В качестве визуальных сигналов мы используем карту Bird's-Eye View (BEV) для передачи глобального контекста задач и сохранения части тела робота в эгоцентрическом наблюдении, чтобы разоблачить материализующийся контекст. Эти сигналы служат руководством для планировщика видео, в то время как IDM переводит плотные поля потока из видеоплана на действия роботов. Благодаря визуальному кодированию глобального контекста задач, CueNav достигает почти 2х успехов в лабиринте навигации чем планирование без сигнала. Сознательный взгляд на IDM позволяет точно осуществлять плавание с 70% успехом в узком проходе, когда методы сопоставления во многом не позволяют выполнить задачу. Мы также…
Видеопланировка видеопрограммы для общей навигации роботов
arXiv:2609.16737v1 Annualce Type: кросс-бюллетень: Генерационные видеомодели могут служить перспективной основой для навигации роботов, предсказывая будущие наблюдения как видеопланы. Последние подходы часто обусловливают планирование видео с помощью кратко-горизонтного руководства и восстановление геометрических точек посредством реконструкции места событий, в результате чего более долгосрочное планирование и точный перевод видео на действия остаются менее изученными. Мы представляем CueNav, навигационную систему на основе видеомодели, объединяющую визуальное планирование видео с олицетворением модели Обратной Динамики (IDM). В качестве визуальных сигналов мы используем карту Bird's-Eye View (BEV) для передачи глобального контекста задач и сохранения части тела робота в эгоцентрическом наблюдении, чтобы разоблачить материализующийся контекст. Эти сигналы служат руководством для планировщика видео, в то время как IDM переводит плотные поля потока из видеоплана на действия роботов. Благодаря визуальному кодированию глобального контекста задач, CueNav достигает почти 2х успехов в лабиринте навигации, чем без планирования