DataFlex-RL: платформа оценки политики в области данных RLVR

#DataFlex-RL #RLVR #Annualce #Type #Habrial

arXiv: 2609.060107v1 Annualce Type: New Habrial: Data Policies for Unterention with поддающиеся проверке награды (RLVR) определяют, какие виды использования используются, насколько сильно они взвешиваются и какие области способствуют последующим комплектам учебных материалов. Мы внедряем DataFlex-RL, платформу оценки для сопоставления этих вариантов по общему рецепту GPSO. Наш первичный эксперимент оценивает 13 конфигураций из 12 схожих семян с использованием Qwen2,5-7B-Base и 12 математики, логики и научных ориентиров. Единообразная ГППО повышает среднесбалансированный уровень точности данных на 7,76 процентных пункта по неподготовленному контрольно-пропускному пункту. Ни один из восьми методов отбора или перевзвешения не позволяет установить доверительный интервал в 95% пар, исключающий нулевое значение по отношению к однородному отбору проб и ни одна из трех адаптивных смесей не превышает фиксированную равную смесь с одинаковым уровнем точности. Исправленное 12-семенное расширение Llama-3.1-8B-Base поместит дополнительные методы в ту же шкалу баллов, что и оригинальный conto

Компьютерные науки > Машинное обучение [представлено 5 сентября 2026 года] Название: DataFlex-RL: A assessment Plaform for RLVR Datability Policies View PDF HTML (экспериментальный) Резюме: The Datata policy for amplementation with поддающееся проверке вознаграждение (RLWR), определяет, какие виды использования используются, насколько сильно они взвешиваются и какие области способствуют последующим комплектам учебных материалов. Мы внедряем DataFlex-RL, платформу оценки для сопоставления этих вариантов по общему рецепту GPSO. Наш первичный эксперимент оценивает 13 конфигураций из 12 схожих семян с использованием Qwen2,5-7B-Base и 12 математики, логики и научных ориентиров. Единообразная ГППО повышает среднесбалансированный уровень точности данных на 7,76 процентных пункта по неподготовленному контрольно-пропускному пункту. Ни один из восьми методов отбора или перевзвешения не позволяет установить доверительный интервал в 95% пар, исключающий нулевое значение по отношению к однородному отбору проб и ни одна из трех адаптивных смесей не превышает фиксированную равную смесь с одинаковым уровнем точности. Исправленное 12-семенное расширение Llama-3.1-8B-Base ставит дополнительные методы в ту же шкалу баллов, что и первоначальные механизмы контроля, но не показывает последовательного победителя с точки зрения наблюдаемой средней производительности. Мы также количественно оцениваем чувствительность к оценке, переоценив девять прогонов Qwen2,5-7B-инструкции с использованием…