Драйв Зеро: " От конца до конца &qt; , выйдя за пределы человеческих демонстраций

#Драйв #Зеро #Annuaire #Type #Humber

arXiv: 26009,060555v1 Annuaire Type: New Humber Brieflow: Большинство систем автономного вождения учатся, подражая человеческим журналам вождению, оставляя свое усвоенное поведение ограниченным качеством и поведенческими характеристиками зарегистрированных траекторий. В этом докладе представлена система "Драйвзеро", которая в конечном итоге учится вождению, помимо человеческих демонстраций. Он разлагает модель восприятия и модели действий, предупредяет каждого из них в режиме, который лучше всего подходит для него, и объединяет их в один планировщик. Эти две модели требуют различных рецептов обучения: восприятие должно понимать мир и пользоваться огромными и разнообразными визуальными данными; действия должны взаимодействовать с ним, а также требовать закрытой обратной связи. Что касается действий, то мы введем систему "DirectRL", смешанный агент с замкнутым блоком-подкреплением-обучение. Она преобразует настоящие журналы вождения в интерактивные миры, где привилегированная политика учителей проходит обучение с помощью PPO через закрытый набор. Для модели восприятия, DriveVFM con

Компьютерные науки > Комплектное видение и распознавание моделей [представлено 5 сентября 2026 года] Название: DriiveZero: End-Enthing Beyond Human Demotion View PDF HTML (экспериментальное) Резюме: Большинство систем с автономным вождением из конца обучаются путем имитации человеческого вождения, оставляя свое усвоенное поведение ограниченным качеством и поведенческими характеристиками зарегистрированных траекторий. В этом докладе представлена система "Драйвзеро", которая в конечном итоге учится вождению, помимо человеческих демонстраций. Он разлагает модель восприятия и модели действий, предупредяет каждого из них в режиме, который лучше всего подходит для него, и объединяет их в один планировщик. Эти две модели требуют различных рецептов обучения: восприятие должно понимать мир и пользоваться огромными и разнообразными визуальными данными; действия должны взаимодействовать с ним, а также требовать закрытой обратной связи. Что касается действий, то мы введем систему "DirectRL", смешанный агент с замкнутым блоком-подкреплением-обучение. Она преобразует настоящие журналы вождения в интерактивные миры, где привилегированная политика учителей проходит обучение с помощью PPO через закрытый набор. Для модели восприятия, DriveVFM объединяет несколько замороженных моделей фундамента зрения, включая DINOv3, SigLIP2, SAM и Defth Anthing V2 в единый позвоночник от только необработанных изображений, не требующих каких-либо конкретных аннотаций. DriveZero затем разоблачает эти два…