Извлеченная из изображения компрессия для моделей зрения, языка и действий
arXiv:2606.16253v2 Annuate Type: заменить резюме: модели Vision-Language-Action (VLA) все чаще полагаются на высокочастотные многокамерные наблюдения, превращая визуальные коммуникации в основной узкий пункт для контроля роботов в режиме реального времени в конфигурациях с ограниченной пропускной способностью или при распределении. Вместе с тем существующие коды изображений и видеоматериалов предназначены для сохранения общей визуальной верности, а не контроля за результатами политики VLA вниз по течению. В этой работе мы внедряем SPARC (SPatial Adventive From Control), изучённую систему сжатия изображений, разработанную для роботов с VLA. Наше ключевое замечание состоит в том, что значение визуальной информации существенно варьируется как по видеокамерам, так и по пространственным районам в рамках изображения. Исходя из этого наблюдения, SPARC использует легковесный височный переключатель маски, который адаптивно распределяет битрат над латентными представлениями в зависимости от задачной значимости при задействовании временного контекста. Мы далее введем снижение ставки, которое стабилизирует обучение