Как скомпрессировать КВ-каше в RL после обучения? Теневая маска дистилляция для приведения памяти в соответствие
arXiv: 2605.06850v2 Annuates Type: заменить резюме: усиление обучения (RL) стало важнейшей парадигмой для раскрытия передовых умозащитных возможностей крупных языковых моделей (LLM), охватывающих такие рамки, как RLHF и RLAIF. Независимо от конкретного алгоритма оптимизации (например, PPO, GRPo или Online DPO), для онлайнового RL по своей сути требуется этап поиска траектории движения (прокат). Однако для решения долгосрочных задач в области рассуждения эта фаза развертывания создает суровую «памятную стенку» из-за непомерного следа кэша Key-Value (KV). При применении кэш-каша во время запуска смягчает накладные расходы на память, это вызывает критический неполитический сбой. Хотя современное сжатие KV зачастую практически не терпит потерь в ходе стандартного вывода, даже незначительные ошибки приближения резко усугубляются нестабильностью оптимизации RL. В частности, образец генерирует ответы в ограниченном контексте, тогда как учащийся обновляет параметры с использованием полного,