Компьютерные науки > Вычисления и язык [представлен 12 сентября 2026 года] Название: " Отмена нераскрываемого: учебная программа с руководством преподавателей для эффективного использования данных RLVR View PDF HTML (экспериментальный) резюме: Укрепление обучения с поддающимися проверке ревардами (RLVER) продемонстрировали замечательный успех в улучшении математических рассуждений крупных языковых моделей. Тем не менее проблемы, выходящие за рамки нынешних возможностей модели, когда внедрение модели в одинаковой степени проваливается и не генерируется никакого учебного сигнала, имеют структурное значение, несмотря на то что они обозначают наиболее информативную границу обучения. Мы показываем, что эти проблемы в других областях могут быть решены с помощью обучения на основе учебных программ, ориентированных на преподавателей: частичные рассуждения из более сильной модели создают градиентную картину трудностей и обратный учебный план постепенно отменяет руководство до тех пор, пока эта модель не решит проблем без помощи. Обучение только 128 неразрешимым проблемам соответствует или превышает ГППО, обученной по полной 2000-проблемному корпусу (~16x эффективности данных) средней девятибалансовой таблице для обеих базовых моделей при значительном расширении границ рассуждений, измеряемых пропуском@k на большом k. Кроме того, мы идентифицируем расходы в связи со сменой распределения, которые особенно высоки при неразрешимом режиме, и предлагаем программу обучения пограничной…
Отмена неразрешимой: учебная программа, разработанная под руководством преподавателей и предназначенная для использования в целях сбора данных
arXiv: 2609.13997v1 Annuales Type: New Habstratement: Unerputing Learning with Verible Rewards (RLVR) продемонстрировали замечательный успех в совершенствовании математических рассуждений крупных языковых моделей. Тем не менее проблемы, выходящие за рамки нынешних возможностей модели, когда внедрение модели в одинаковой степени проваливается и не генерируется никакого учебного сигнала, имеют структурное значение, несмотря на то что они обозначают наиболее информативную границу обучения. Мы показываем, что эти проблемы в других областях могут быть решены с помощью обучения на основе учебных программ, ориентированных на преподавателей: частичные рассуждения из более сильной модели создают градиентную картину трудностей и обратный учебный план постепенно отменяет руководство до тех пор, пока эта модель не решит проблем без помощи. Обучение только 128 неразрешимым проблемам соответствует или превышает ГППО, обученной по полной 2000-проблемному корпусу (~16x эффективности данных) средней девятибалансовой таблице для обеих базовых моделей при значительном расширении границ рассуждений, измеряемых пропуском@k на большом k. Кроме того, мы идентифицируем распределительную передачу