LEPS: Слатно-ориентированное исследование - оперативный отбор проб для эффективного РЗВВ в крупных языковых моделях

#LEPS #Слатно-ориентированное #РЗВВ #Annuales #Type

arXiv: 2607.28077v2 Annuales Type: заменить резюме: " Укрепление обучения с поддающимися проверке наградами (RLVR) повышает умения крупных языковых моделей, однако оперативные группы с идентичными поощрениями по внедрению потребляют бюджет генерации без эффективных учебных сигналов. Предварительный оперативный отбор может привести к сокращению объема этих отходов путем проверки оперативных процедур до их внедрения. Вместе с тем существующие методы предварительного катания из одной зоны в другую не позволяют обеспечить сбалансированность добычи и разведки: многократное использование исторически информативных сигналов может ограничить охват подготовки кадров, тогда как более широкая разведка может уменьшить количество информационных импульсов. Для устранения этих ограничений мы введем LEPS, Latent-Guided Research - Exploit Exploit Spection Pebler, который адаптивно уравновешивает повторное использование ранее наблюдаемых информационных сигналов с продолжением исследования неопределенностей. ЛИПС распределяет кандидатов на использование и изучение портфелей и адаптационно распределяет бюджет для внедрения в соответствии с их недавними нетривиальными коэффициентами. Это

Компьютерная наука > Расчет и язык [представлен 30 июля 2026 (v1), последний пересмотренный 16 сентября 2026 года (эта версия, v2)) Название: LEEPS: Latent-Guided Study- Exploit Opening Test for Effective RLVR в больших языковых моделях Вид PDF HTML (экспериментальное) Резюме: Учеба с поддающимися проверке наградами повышает логическую способность крупных лингвистических моделей, однако оперативные группы с идентичными стимулами для развертывания поглощают бюджет генерации без эффективных учебных сигналов. Предварительный оперативный отбор может привести к сокращению объема этих отходов путем проверки оперативных процедур до их внедрения. Вместе с тем существующие методы предварительного катания из одной зоны в другую не позволяют обеспечить сбалансированность добычи и разведки: многократное использование исторически информативных сигналов может ограничить охват подготовки кадров, тогда как более широкая разведка может уменьшить количество информационных импульсов. Для устранения этих ограничений мы введем LEPS, Latent-Guided Research - Exploit Exploit Spection Pebler, который адаптивно уравновешивает повторное использование ранее наблюдаемых информационных сигналов с продолжением исследования неопределенностей. ЛИПС распределяет кандидатов на использование и изучение портфелей и адаптационно распределяет бюджет для внедрения в соответствии с их недавними нетривиальными коэффициентами. Кроме того, в нем используются соседи-представители и космические соседи и исторические…