ВАРП-ВЛА: Адаптация Wrist-Camera к осуществлению политики с учетом перспективного видения в моделях Language-Action
arXiv: 2610.11508v1 Annuate Type: recred Brief: Несмотря на последние достижения в модели Vision-Language-Active (VLAs) для роботизированных манипуляций, их эффективность остается чувствительной к изменениям конфигурации камеры. Эта проблема становится более очевидной в случае перекрестного монтажа, поскольку воспроизвести точную позу камеры, используемой для обучения, практически невозможно. В отличие от фиксированного внешнего вида, вид на запястье является более сложным, поскольку камера движется с роботом, что приводит к даже небольшим вариациям роста для изменения тонкозернистых геометрических сигналов. Для решения этой проблемы мы предлагаем WARP-VLA, крепкую VLA видеокамер для различных конфигураций запястьев. WARP-VLA использует архитектуру Mixture of Experts (MOE), в которой отдельные эксперты изучают специфические изменения функций, и маршрутизатор сочетает их на основе имплицитной информации. Это позволяет применять эту политику, не требуя использования внешних параметров камеры в качестве дополнительного ввода данных. Благодаря экспериментам с контрольным показателем LIBERO WARP-VLA улучшает авераг