Реклама

ЭвоРубрик: Самодефицирующаяся " Rutric-Driven RL &qt; для поколения открытого состава

#ЭвоРубрик #Самодефицирующаяся #Rutric-Driven #Annuales #Type

arXiv:2605.29847v2 Annuales Type: заменить резюме: " Укрепление системы обучения (RL) < - усовершенствование моделей Большого языка в поддающихся проверке областях, тогда как неограниченное поколение по-прежнему сопряжено с трудностями изза отсутствия окончательных вознаграждений. РL на основе графических материалов содержит четкие критерии оценки, однако обучение разработке этих критериев по-прежнему сопряжено с трудностями в тех случаях, когда правильность окончательных ответов не поддается проверке. Мы предлагаем " ЭвоРубрик &qt; , кореволюционную рамочную программу RL, которая сочетает в себе отзывы о применимости критериев, дискриминацию по реагированию и соглашение между коллегами об изучении предметов для открытого поколения. Совместная политика действует как в качестве разума, так и в качестве генератора " Rutric Performer > , используя свои нынешние ответные действия и исторические рубрики для выявления новых аспектов оценки. Для сочетания адаптивного открытия строк со стабильной проверкой достоверности замороженная копия первоначальной политики используется в качестве Meta-Verifier, тогда как замороженный Grader дает ответы по сохраняемым критериям. Дискриминационная обратная связь, консенсус " Оставь - один-выход &qt; и

Компьютерная наука > Расчет и язык [представлен 28 мая 2026 (v1), последний пересмотренный вариант от 8 октября 2026 года (эта версия v2)) Название: EvoRubric: Саморегулирующийся RL для открытого поколения PDF HTML (экспериментальный) резюме: Учёба по вопросам обеспечения соблюдения (RLL) позволила усовершенствовать модели большого языка в поддающихся проверке областях, тогда как открытое поколение остается непростым из-за отсутствия окончательного вознаграждения. РL на основе графических материалов содержит четкие критерии оценки, однако обучение разработке этих критериев по-прежнему сопряжено с трудностями в тех случаях, когда правильность окончательных ответов не поддается проверке. Мы предлагаем " ЭвоРубрик &qt; , кореволюционную рамочную программу RL, которая сочетает в себе отзывы о применимости критериев, дискриминацию по реагированию и соглашение между коллегами об изучении предметов для открытого поколения. Совместная политика действует как в качестве разума, так и в качестве генератора " Rutric Performer > , используя свои нынешние ответные действия и исторические рубрики для выявления новых аспектов оценки. Для сочетания адаптивного открытия строк со стабильной проверкой достоверности замороженная копия первоначальной политики используется в качестве Meta-Verifier, тогда как замороженный Grader дает ответы по сохраняемым критериям. Дискриминационная обратная связь, консенсус участников " Out-One-Out > и постоянный пул памяти преобразуют эту…