Компьютерная наука > Компютерное видение и распознавание шаблона [представлено 15 сентября 2026 года] Название: sensVLA: Statural-Groaded Vision, Language-Action Model for Automitary Wheel Displace View PDF HTML (экспериментальное) Резюме: Автономный контроль за погрузчиком колес требует совместного обоснования задач семантики, эгоцентрического зрения, proprioecepation и 3D геометрии сцены. Мы представляем сенсВЛА, архитектуру Vision-Language-Action (VLA), которая объединяет модель Qwen3-2B Vieting- Language (VML) и полностью подготовленного специалиста по трансформаторным действиям, обученного регрессии скорости потока. Этот проект отделяет пространственную основу от лингвистических рассуждений, сохраняя при этом взаимодействие между двумя потоками в момент принятия решения. Эксперт прогнозирует шесть параметров действий: продольная скорость, рулевое управление, смещение корпуса, оборот руки и скорость ведра. В реальном мире данные, получаемые от погрузчика колес, достигают совокупного паритета в расчете на один шаг при наличии мощного исходного показателя только для камеры и уменьшают продольную скорость RMSE на 28% и погрешность смещения на 9% по сценариям нагрузки центриром. Кроме того, при повреждении или удалении потока видеокамер он на 29% снижается, что свидетельствует о том, что эксплицитное пространственное заземление повышает точность и допустимость неисправностей в отношении автономности тяжелого оборудования. История представления: Gopi Krishna Erabati [видение…
SensVLA: Модель пространственно-широкого видения, освещения и действий для автономного погрузчика колес
arXiv:2609.17021v 1 Annuales Type: New Humber Briefload: Автономный контроль за погрузчиком колес требует совместного обоснования задач семантики, эгоцентрического зрения, proprioception и геометрии 3D. Мы представляем сенсВЛА, архитектуру Vision-Language-Action (VLA), которая объединяет модель Qwen3-2B Vieting- Language (VML) и полностью подготовленного специалиста по трансформаторным действиям, обученного регрессии скорости потока. Этот проект отделяет пространственную основу от лингвистических рассуждений, сохраняя при этом взаимодействие между двумя потоками в момент принятия решения. Эксперт прогнозирует шесть параметров действий: продольная скорость, рулевое управление, смещение корпуса, оборот руки и скорость ведра. На реальных данных от погрузчика колеса sensVLA достигает совокупного показателя на шаг