Реклама

Перестраивание семантики, динамики и контроля: простые, но эффективные действия - три стрима трансформатор

#Перестраивание #Annuation #Type #Brieft #Vision-Language-Action

arXiv: 261.10.11416v 1 Annuation Type: cross Brieft: Vision-Language-Action (VLA) стали заметной основой для сложных роботизированных манипуляций, опираясь на глубокое семантическое понимание заранее подготовленных моделей Vieting- Language (VMS). Однако такие позвоночники VLM не дают достаточных физических динамичных предпочтений, что ограничивает возможности обобщения политики роботов. В этой связи недавние усилия позволили интегрировать мировые модели (ВМ) видеопроизводства в политику роботов с помощью различных стратегий, используя прогнозируемую динамику для содействия выработке практических мер. Несмотря на эти достижения, использование семантического понимания и прогнозирования динамики в качестве дополнительного руководства для выработки практических мер по-прежнему сопряжено с трудностями. В этом документе мы вносим $\matrm {ACT}3 долл., простой, но эффективный Action-Centric Tri-Stream Transformer, который взрывает информацию о семантической и динамической динамике в контрольные действия при сохранении различных ролей потоков контекстов. Если говорить конкретно, то $\matrm {ACT}3 долл.