Быстрее: Нужны ли модули для разработки моделей действий в мире?
arXiv: 2608.02365v2 Annuales Type: заменить резюме: World Action Models (WAM) построены на заранее подготовленных видеомоделях, чьи представления основаны на физической динамике и служат естественной основой для прогнозирования действий. Несмотря на этот естественный фундамент, многие WAM по-прежнему зависят от глубоких, сложных параметров и предукций, которые сопряжены с высокой степенью запоздалости и могут быть переоценены в ограниченных демонстрациях роботов, что ограничивает их реальную применимость. В этом документе мы выступаем за принцип, ориентированный на мировую модель и предусматривающий концентрацию потенциала и вычисления в видео-мировой модели, а эксперт по легковесным действиям преобразует представления позвоночника в практические действия роботов. Мы реализуем этот принцип с помощью трех ключевых вариантов: Dock of Transformers (DOT) вместе с Lite KV-Fusion, чтобы предоставить неглубокому и легкодействующему эксперту доступ к представлениям со всех слоев видео; только для мировой модели - кондиционирование эксперта по действию; а также убрать 1D-ROPE для позиционной увязки между клавишами видео.