Реклама

Рекурсивное обучение агентского робота видео in-contes

#Рекурсивное #Annuales #Type #Демонстрационное #Полное

arXiv: 2610,06843v 1 Annuales Type: кросс-бюллетень: агенты LLM, которые организуют политику замороженного языка зрения (VLA), совершенствуются в разных эпизодах через текстовую память, которая регистрирует то, что сделал агент, но не как выполняется задача. Демонстрационное видео показывает это, но плохо подходит к контексту агента. Полное видео замедляет каждый поворот, стационарные клавиатуры теряют контактную деталь, которая решает, удерживается ли ухватка и что нужно агенту изменить структуру задачи при планировании на рамки вокруг каждого контакта. Мы внедряем метод рекурсивного видеоинтертекст-обучения (RV-ICL), который без подготовки превращает демонстрацию в иерархию, которую использует агент, а не как быструю. Иерархия построена на основе подсобытий демонстрации, таких как хватки и выбросы. Его уровни становятся более тонкими, начиная от клавиатур всей задачи и кончая фазами, моментами и короткими обложками, а также подвергаются воздействию только с помощью инструментов для чтения. Агент читает тяжёлые уровни перед планированием. Во время казни r

Компьютерные науки > Роботы [представлен 5 октября 2026 года] Название: Recursive Video In-Context Learning for Agential Robot View PDF HTML (экспериментальный) Резюме: агенты LLM, которые организуют политику замороженного языка зрения и действия (VLA), совершенствуют в ряде эпизодов через текстовую память, которая регистрирует то, что сделал агент, но не как выполняется задача. Демонстрационное видео показывает это, но плохо подходит к контексту агента. Полное видео замедляет каждый поворот, стационарные клавиатуры теряют контактную деталь, которая решает, удерживается ли ухватка и что нужно агенту изменить структуру задачи при планировании на рамки вокруг каждого контакта. Мы внедряем метод рекурсивного видеоинтертекст-обучения (RV-ICL), который без подготовки превращает демонстрацию в иерархию, которую использует агент, а не как быструю. Иерархия построена на основе подсобытий демонстрации, таких как хватки и выбросы. Его уровни становятся более тонкими, начиная от клавиатур всей задачи и кончая фазами, моментами и короткими обложками, а также подвергаются воздействию только с помощью инструментов для чтения. Агент читает тяжёлые уровни перед планированием. Во время исполнения он возвращается в иерархию, когда шаг требует больше деталей и загружает только клип своей текущей подцели. Одной демонстрации на каждую задачу достаточно. Построенный на RPent, RV-ICL обеспечивает успех с 92,6% до 96,5% по LIBERO-PRO и с 86,7% до 95,8% по LYBERo-Plus. Текущий контекст просмотра:…