Компьютерные науки > Машинное обучение [представлено 6 октября 2026 года] Название: На KL-Regularized Policy Optimation View Abstract: Asynchronous Update (RL) для агентов большой языковой модели (LLM) обучает одну политику траекторий, генерируемых другой: разбрасывание происходит с помощью запоздалых контрольно-пропускных пунктов и вероятность работы двигателя отличается от вероятности тренера даже на идентичных параметрах. Стандартные средства правовой защиты либо представляют собой коэффициент значимости клипов, который искажает обновление данных, либо, как в ГРП, отбирают группу ответов на каждую оперативную операцию, что сопряжено с большими затратами при длинных эпизодах. Мы предлагаем KL-Regularized Policy Оптимизацию (KLPO) — систему, которая крепит KL регулярность в пробоотборнике. Затем на этапе регулярного усовершенствования используется решение в закрытой форме Gibbs, и KLPO соответствует своему log-соотношению оптимальных параметров наименьших квадратов к собственным траекториям пробоотборника, так что вероятность отбора проб поступает через log ratio и не требуется никаких весов. Профилирование отрезка регрессии заменяет неразрешимую функцию log-partition на среднее значение пробоотборника сигнала плюс отклонение от KL от образца к тренеру. Для целей зеркального спуска на уровне символической политики мы показываем, что результирующий градиент может быть рассчитан из конечной доходности без критиков, через оценки в пробоотборниках или один траекторийный остаток…
Оптимизация политики в области KL
arXiv: 2610,08963v 1 Annuate Type: New Humber: Asynchronous Upduction (RL) для агентов с большой языковой моделью (LLM) обучает одну политику в отношении траекторий, генерируемых другой: выбрасывание происходит из застенчивых контрольно-пропускных пунктов, а вероятность вывода двигателя отличается от вероятности тренера даже на идентичных параметрах. Стандартные средства правовой защиты либо представляют собой коэффициент значимости клипов, который искажает обновление данных, либо, как в ГРП, отбирают группу ответов на каждую оперативную операцию, что сопряжено с большими затратами при длинных эпизодах. Мы предлагаем KL-Regularized Policy Оптимизацию (KLPO) — систему, которая крепит KL регулярность в пробоотборнике. Затем на этапе регулярного усовершенствования используется решение в закрытой форме Gibbs, и KLPO соответствует своему log-соотношению оптимальных параметров наименьших квадратов к собственным траекториям пробоотборника, так что вероятность отбора проб поступает через log ratio и не требуется никаких весов. Профилирование отрезка регрессии заменяет неразрешимую функцию log-partition на среднее устройство для отбора проб сигнала плюс пробоотборник -