" ThinkPrior: Zero-Rollout challenge Prors for Cold Start Start Spective Selective Brited in RLVR

#ThinkPrior #Zero-Rollout #Prors #Cold #Start

arXiv: 2609,09075v1 Annualce Type: New Humber Abstract: В процессе укрепления обучения с поддающимися проверке наградами (RLVR), подготовленным в рамках групповой относительной оптимизации политики (GRPO) изучаемый здесь термин " бесплатное вознаграждение-выгода &qt; зависит от вариации вознаграждения внутри группы. Если все развороты в группе правильные или неверные, то их групповые преимущества идентичны нулю; эти группы с нулевым преимуществом не дают градиента выгод для вознаграждения, но единообразный выбор расходовает 39% от общего объема работы на них. d) в рамках оперативного отбора, основанного на истории, необходимо сначала тратить средства на проведение целевых политических мероприятий для оценки трудностей, создавая холодное начало с отходами, образующимися при запуске; Ставка якорного пропуска проверяется по внешней инициализации для запоздалого Beta; ThinkPrior выбирает на основе ожидаемой возможности обучения, а затем обновляет результаты тренировок, не меняя ни потерь, ни потерь.