Компьютерные науки > Робототехника [представлен 16 сентября 2026 года] Название: " Обновление обучения для целей реального видения, политики Language-Action View PDF HTML (экспериментальное) резюме: Учёба по вопросам усовершенствования на основе больших и заранее подготовленных моделей Vision-Language-Active (VLA), открывает перспективы для высоконадежного использования роботов. Однако из-за масштабов современных моделей VLA с большой запозданием, поэтому наблюдение, используемое для отбора действия, часто не проходит в течение времени исполнения, что создает сдвиг в распределении, который может существенно снизить надежность и эффективность. В ходе предыдущей работы изучался асинхронный характер осуществления политики в целях уменьшения последствий запоздалости, однако эти методы основаны главным образом на имитации обучения и не обеспечивают никакого механизма для перехода от распределения учебной подготовки к повышению надежности. Мы закрываем этот пробел, давая возможность откорректировать RL в соответствии с требованиями контроля в режиме реального времени динамических реальных манипуляций. Наш подход основывается на EXPO-FT, механизме для выборочной эффективной и надежной корректировки VLA с помощью дополнительного обучения, а также на медленном, быстротечном генерации резких действий от быстрых реактивных редакторов: большой заранее подготовленный VLА предлагает действия с использованием своего сильного поведения до этого, в то время как политика легкой…
Укрепление системы обучения в целях разработки политики в области перспективного подхода к работе с языками в реальном масштабе времени
arXiv:2609.18207v1 Annuation Type: Cross Brieft: Strengment Undered-bearning incording on bighlish, predited Vision-Language-Active (VLA) — это перспективное использование высоконадежных роботов. Однако из-за масштабов современных моделей VLA с большой запозданием, поэтому наблюдение, используемое для отбора действия, часто не проходит в течение времени исполнения, что создает сдвиг в распределении, который может существенно снизить надежность и эффективность. В ходе предыдущей работы изучался асинхронный характер осуществления политики в целях уменьшения последствий запоздалости, однако эти методы основаны главным образом на имитации обучения и не обеспечивают никакого механизма для перехода от распределения учебной подготовки к повышению надежности. Мы закрываем этот пробел, давая возможность откорректировать RL в соответствии с требованиями контроля в режиме реального времени динамических реальных манипуляций. Наш подход основывается на ЭКСПО-ФТ, механизме для эффективной выборки и надежной корректировки ВЛА с помощью дополнительного обучения, а также на медленном и быстродействующем формировании активных действий.