Оперативная разведка

#Оперативная #Аннонс #Разведка #Стандартные #Крупные

arXiv: 2607.08837v3 Аннонс Тип: заменить резюме: Разведка имеет важное значение для RL, поскольку политика не может улучшиться путем неоднократного отбора поведения, которое она уже предпочитает. Стандартные методы вводят стохастичность в пространство действия, но такая дрожащая штука дает только скачки близко к оригиналу. Для того чтобы избежать слабой политики, часто требуются глобальные волнения, которые не могут привести к шуму. Крупные языковые модели (ЛММ) и модели наглядного языка-действия (ВЛА) обеспечивают путь: они определяют политику в зависимости от естественного языка быстро, а поскольку внедрение происходит по ее итогам, изменение оперативного процесса вызывает глобальные изменения. Задача состоит в том, чтобы найти причины для полезных глобальных изменений. При слабой политике, которая редко приносит успех, вознаграждение слишком мало для того, чтобы выбирать. Наша идея состоит в том, чтобы усовершенствовать сигналы от самих разворотов: модель языка зрения (VLM) мотивирует видео с прокатом, диагностирует реакцию политики и перепишет сигнал для лучшего поведения в следующий раз. Эта процедура напоминает пост