Компьютерная наука > Вычисление и язык [представлен 7 мая 2026 (v1), последний пересмотренный 6 сентября 2026 года (эта версия, v3)] Название: Переосмысление RL для LLM Рассказывающая: Это отбор Sparse Policy Selection, Невозможность обучения PDF HTML (экспериментальное) Резюме: Обучение в целях обеспечения применения стало стандартом для совершенствования рассуждения в крупных языковых моделях, однако все больше фактов указывает на то, что RL не преподаёт новых стратегий; оно перераспределяет вероятностную массу по сравнению с уже содержащимися в базовой модели решениями. В этой работе мы задаемся вопросом: если RL просто направляет модель к путям, которые она уже знает, является ли сам цикл оптимизации RL необходимым? С помощью анализа на уровне символов в различных семьях моделей и алгоритмах RL мы видим, что выгодный отпечаток RL - это небольшая предсказуемая коррекция, сосредоточенная в точках принятия решений с высокой степенью вероятности, где модель неопределённа, какой сектор принимать. Только 1-3% символических позиций затронуты, рекламированный символ всегда находится в верхних пяти альтернативах базовой модели и адресные корректировки на этих немногих позициях причинно восстанавливают значительную часть повышения точности RL, а случайная коррекция не работает. Энтропия базовой модели определяет эти позиции без какой-либо модели RL, и вся коррекция является малоразмерной, репрезентативной в крошечной части параметров моделей. Эти выводы переформулируют улучшение…
Переосмысление RL для обоснования LLM: это отбор политики Sparse, а не обучение способности
arXiv: 2605.06241v3 Annuates Type: заменить резюме: Усиление обучения стало стандартом для совершенствования рассуждений в крупных языковых моделях, однако все больше фактов указывает на то, что RL не преподает новых стратегий; он перераспределяет вероятностную массу над решениями, которые уже содержатся в базовой модели. В этой работе мы задаемся вопросом: если RL просто направляет модель к путям, которые она уже знает, является ли сам цикл оптимизации RL необходимым? С помощью анализа на уровне символов в различных семьях моделей и алгоритмах RL мы видим, что выгодный отпечаток RL - это небольшая предсказуемая коррекция, сосредоточенная в точках принятия решений с высокой степенью вероятности, где модель неопределённа, какой сектор принимать. Только 1-3% символических позиций затронуты, рекламированный символ всегда находится в верхних пяти альтернативах базовой модели и адресные корректировки на этих немногих позициях причинно восстанавливают значительную часть повышения точности RL, а случайная коррекция не работает. Энтропия базовой модели определяет эти позиции с