Компьютерные науки > Роботы [представлены 15 сентября 2026 года] Название: Возвращение роботов к системе Vtrinsic Robot: Воспроизведение VLA представительств для автономной оценки и совершенствования политики PDF HTML (экспериментальное) резюме: Vision-language-activersation (VLA) системы уже объединяют два ценных ресурса для обучения роботам: богатое визуальное представление и демонстрация успешного выполнения задач. Интринсик Робот Вознаграждение (ИРР) предлагает использовать эти ресурсы для второй, взаимодополняющей цели: оценки собственных результатов робота и обеспечения обратной связи в целях совершенствования политики. Успешные демонстрационные конечных точек определяют ссылки на конкретные задачи, а замерзший визуальный энкодер в политике обеспечивает функциональное пространство для оценки новых результатов. Основной механизм поощрения добавляет к существующему трубопроводу эталонный банк и определяющую операцию, не требуя отдельного опытного специалиста по оценке или дополнительной опоры восприятия. Наша позиция заключается в том, что такое повторное использование открывает многообещающий путь к снижению интеграционных усилий, эффективному расчету вознаграждения и сокращению числа повторяющихся человеческих результатов. Опираясь на уже проведенные исследования в области визуального вознаграждения и изучения опыта, ИРР вносит эти идеи в существующий интеллектуальный и демонстрационный трубопровод робота. Эксплуатационный демонстратор COMAU Grounder 3 имеется на…
Вознаграждение роботов: повторное использование представительства VLA для самостоятельной оценки и совершенствования политики
arXiv:2609.171151v1 Видение типа: перекрестное резюме: системы " Vision-Language-Action (VLA) &qt; уже объединяют два ценных ресурса для обучения роботам: богатая визуальная презентация и демонстрация успешного выполнения задач. Интринсик Робот Вознаграждение (ИРР) предлагает использовать эти ресурсы для второй, взаимодополняющей цели: оценки собственных результатов робота и обеспечения обратной связи в целях совершенствования политики. Успешные демонстрационные конечных точек определяют ссылки на конкретные задачи, а замерзший визуальный энкодер в политике обеспечивает функциональное пространство для оценки новых результатов. Основной механизм поощрения добавляет к существующему трубопроводу эталонный банк и определяющую операцию, не требуя отдельного опытного специалиста по оценке или дополнительной опоры восприятия. Наша позиция заключается в том, что такое повторное использование открывает многообещающий путь к снижению интеграционных усилий, эффективному расчету вознаграждения и сокращению числа повторяющихся человеческих результатов. Использование результатов уже проведенных исследований в области награды за визуальные достижения и обучения с помощью экспозиции