Репликация опыта на уровне " Rollout Advante-Prioritized > для GPSO

#Репликация #Rollout #Advante-Prioritized #GPSO #Annuation

arXiv: 2606.045660v3 Annuation Type: заменить резюме: " Укрепление знаний на основе поддающихся проверке вознаграждений с помощью GPSO < ( &lgt;) является стандартным подходом к постпрофессиональным аргументациям в пользу МЛМ. Она остается неэффективной. Каждая развертывание используется для одного обновления градиента и затем отменяется. Наивная повторная игра не очень подходит в этой среде, потому что политика LLM быстро дрейфует на шаг к уклону. Таким образом, хранение документов становится застывшим и может дестабилизировать процесс обучения. Мы предлагаем буфер для репроигрывания на уровне разворота для GPSO, который хранит и отбирает отдельные броски вместо целых групп. Абсолютный предел через возрастное выселение. Любое внедрение, более старое чем тау_макс. тренировочные шаги удаляются. Кроме того, буфер сохраняет данные о политике с помощью свежего состава. Каждая партия держит свои свежие политические развороты, а затем перепроигрывает реплики отдельно от буфера. Мы придаем первостепенное значение повторному воспроизведению в зависимости от величины преимуществ каждого запуска и рециклируем индивидуальные развороты, преимущества которых велики. Через три Qwen3-Base sca