Компьютерные науки > Машинное обучение [представлено 11 июля 2026 (v1), последний пересмотренный вариант от 8 октября 2026 года (эта версия v2)) Название: Beyond Euclidean Clopping: Преодоление коллапсов исследований в LLM RL с помощью Riemannian Isological Policy Optimization View PDF HTML (экспериментальное) Резюме: Обучение по вопросам восстановления (RLI) стало доминирующей парадигмой для расширения возможностей МП. Однако алгоритмы RL с PPO-Clip по своей сути ограничены коллапсом разведки. Последующие работы остаются главным образом эвристическими и не позволяют выявить основную причину провала PPO-Clip. Эта работа показывает фундаментальный недостаток PPO-Clip: она имплицитно измеряет расхождения в политике с использованием метрики Евклидов, которая теоретически не совместима с внутренней геометрией политико-многообразной системы Riemanian. Это геометрическое несоответствие приводит к чрезмерно консервативным обновлениям данных в регионах с низкой вероятностью, а агрессивно - в районах с высокой степенью вероятности, что в конечном счете подрывает разведку. Для исправления этого геометрического недостатка мы предлагаем оптимизацию политики изоманского происхождения (РИПО), которая гарантирует обновление изометрической политики по рейманнскому спектру, эффективно уравновешивая исследования и разработки. Мы далее показываем, что РИПО добивается выгодного компромисса между предвзятыми и переменчивыми подходами, который стабилизирует оптимизацию. Широкие эксперименты…
Помимо эвклидианского клипинга: преодоление коллапса исследования в LLM RL через оптимизацию политики изомены Риманна
arXiv:2607.10169v2 Annuales Type: заменить перекрестное резюме: Укрепление обучения (RL) стало доминирующей парадигмой для укрепления уммсвисточных способностей. Однако алгоритмы RL с PPO-Clip по своей сути ограничены коллапсом разведки. Последующие работы остаются главным образом эвристическими и не позволяют выявить основную причину провала PPO-Clip. Эта работа показывает фундаментальный недостаток PPO-Clip: она имплицитно измеряет расхождения в политике с использованием метрики Евклидов, которая теоретически не совместима с внутренней геометрией политико-многообразной системы Riemanian. Это геометрическое несоответствие приводит к чрезмерно консервативным обновлениям данных в регионах с низкой вероятностью, а агрессивно - в районах с высокой степенью вероятности, что в конечном счете подрывает разведку. Для исправления этого геометрического недостатка мы предлагаем оптимизацию политики изоманского происхождения (РИПО), которая гарантирует обновление изометрической политики по рейманнскому спектру, эффективно уравновешивая исследования и разработки. Далее мы показываем, что РИПО достигает фасада