Сбалансированная диета данных: решение проблем, связанных с разрывом в области разведки в Мега-Шкале RL для контроля за роботами
arXiv: 2610.12465v1 Вид уведомления: перекрестное резюме: роботы общего назначения должны выполнять широкий круг задач, начиная с быстрых ощущений и кончая декстеральными манипуляциями. В то время как обучение по принципу " сим-реальное укрепление > (RL) оказалось полезным инструментом для достижения этой цели, нынешние трубопроводы RL зависят от сложных инженерно-технических и заданных структурных предпочтений, таких как формированные вознаграждения и демонстрации. Недавние работы показали, что различные имитационные перезапуски в сочетании с массовым параллельным моделированием могут во многом облегчить это инженерное бремя по ряду проблем манипулирования. Однако мы считаем, что наивное распространение этой парадигмы на более точные или динамичные проблемы остается нетривиальным. В то время как имитационные перезарядки могут помочь в проведении разведки, единообразное отбор проб по этим распределительным отходам позволяет накопить все большую часть опыта работы с целевыми конфигурациями, которые политика уже освоила или не может сделать. В связи с этим трудно увидеть ожидаемые выгоды от расширения параллельных условий для RL, поскольку значительная часть обучения si