Компьютерная наука > Искусственный интеллект [представлен 5 июля 2026 (v1), последний пересмотренный вариант 7 октября 2026 года (эта версия v2)) Название: VLA Grounder: Language-Conditioning Space Оптимизация для моделей Black-Box VLА View PDF HTML (экспериментальное) резюме: Vision-Language-Action (VLA) обычно рассматриваются как политика в отношении конечных действий, обусловленная описанием задач на естественном языке. Однако на практике их поведение часто сильно зависит от того, как они сформулированы в инструкции, и это означает, что язык является не просто знаком задачи, а оптимальным элементом кондиционирования. Мы изучаем вопрос о том, можно ли усовершенствовать политику в отношении замороженной ВЛА за счет оптимизации языкового пространства вместо обновления весов действий. Наш метод вводит политику кондиционирования языка в космосе, которая преобразует обучение человека в короткую команду VLA с помощью внешнего вида объекта, пространственных отношений и сигналов мишени. Политика в области использования помещений для кондиционирования языков оптимизирована за счет дополнительного обучения, полученного на основе небольших вознаграждений при выполнении задач, тогда как последующий проект АМП остается полностью замороженным. Эксперименты на RL4VLA и VL-Think показывают, что оптимизация пространства для кондиционирования языка повышает успех в решении задач, связанных с регулировкой, символическими и многообъектными манипуляциями, демонстрируя при этом, что язык может…
VLA Grounder: Языковая оптимизация космической деятельности для моделей Black-Box
arXiv: 2607.04517174v2 Тип уведомления: заменить резюме: модели Vision-Language-Action (VLA) обычно рассматриваются как политика действий в конце процесса, обусловленная описанием задач на естественном языке. Однако на практике их поведение часто сильно зависит от того, как они сформулированы в инструкции, и это означает, что язык является не просто знаком задачи, а оптимальным элементом кондиционирования. Мы изучаем вопрос о том, можно ли усовершенствовать политику в отношении замороженной ВЛА за счет оптимизации языкового пространства вместо обновления весов действий. Наш метод вводит политику кондиционирования языка в космосе, которая преобразует обучение человека в короткую команду VLA с помощью внешнего вида объекта, пространственных отношений и сигналов мишени. Политика в области использования помещений для кондиционирования языков оптимизирована за счет дополнительного обучения, полученного на основе небольших вознаграждений при выполнении задач, тогда как последующий проект АМП остается полностью замороженным. Эксперименты на RL4VLA и VL-Think показывают, что оптимизация пространства для кондиционирования языка повышает успех в области обучения с учетом требований к обучению, символического и