Компьютерные науки > Компютерное видение и распознавание моделей [представлено 16 сентября 2026 года] Название: FIVE-VLA: Быстрое и результативное автономный вождение с периодическим просмотром памяти PDF HTML (экспериментальное) Резюме: Современные модели работы на языке зрения (VLА) для автономного вождения - критические ограничения: чрезмерное число параметров, неэффективная обработка изображений высокого разрешения и отсутствие временной памяти. Мы вносим быструю и действенную VLA (пятимерную VLA) для решения этих проблем путем внесения двух ключевых вкладов. Во-первых, мы используем эффективный энкодер зрения, который обрабатывает изображения с высоким разрешением (448 x 896 долл. США) и генерирует только 98 символов, на 5\временей меньше, чем существующие подходы, и полностью обходит текстовое формирование для однопроходного прогнозирования траектории. Во-вторых, мы предлагаем " Периодическую память о действиях &qt; (RAM) - модуль легкого веса, который определяет прогноз действия на предыдущих знаках действий и обеспечивает временной контекст, имеющий решающее значение для маневров, таких как обгон и экстренное торможение. При параметрах только 641M, FIVE-VLA заполняет на 10 процентов больше маршрутов без нарушений правил дорожного движения по сравнению с предыдущим современным VLA в случае сложного контрольного показателя движения в закрытом режиме. Нереактивное симуляционное моделирование с открытым ходом на базе массива данных о физических АИ NVIDIA в реальном…
ПЯТЬ-ВЛА: Быстрое и результативное автономное управление транспортными средствами с периодическими действиями
arXiv:2609.18623v1 Видеотип: новое резюме: современные модели действий на языке зрения (VLA) для автономного вождения с критическими ограничениями: чрезмерный подсчет параметров, неэффективная обработка изображений высокого разрешения и отсутствие временной памяти. Мы вносим быструю и действенную VLA (пятимерную VLA) для решения этих проблем путем внесения двух ключевых вкладов. Во-первых, мы используем эффективный энкодер зрения, который обрабатывает изображения с высоким разрешением (448 x 896 долл. США) и генерирует только 98 символов, на 5\временей меньше, чем существующие подходы, и полностью обходит текстовое формирование для однопроходного прогнозирования траектории. Во-вторых, мы предлагаем " Периодическую память о действиях &qt; (RAM) - модуль легкого веса, который определяет прогноз действия на предыдущих знаках действий и обеспечивает временной контекст, имеющий решающее значение для маневров, таких как обгон и экстренное торможение. При параметрах только 641М ПВОВ-VLA заполняет на 10 процентов больше маршрутов без нарушений правил дорожного движения, чем в предыдущем современном состоянии ВЛА на спорной скамье 2Driv