Смешать или объединить: на пути к многомерному обучению большим языковым моделям
arXiv: 2602,12566v4 Тип уведомления: заменить резюме: усиление обучения с поддающимися проверке ревардами (RLVR) играет ключевую роль в стимулировании четко выраженных умеющих рассуждать моделей большого языка (LMS). Мы можем добиться результатов на уровне экспертов в некоторых конкретных областях с помощью РЛВР, таких как кодирование или математика. Когда требуется общая многодоменная модель экспертного уровня, нам необходимо тщательно рассмотреть вопрос о сотрудничестве РЛВР в различных областях. В нынешних современных моделях используются главным образом две различные концепции подготовки кадров для многодоменных РЛВ: смешанные многоцелевые РЛВР и отдельные РЛВО, за которыми следует слияние моделей. Однако в большинстве работ не содержится подробного сопоставления и анализа этих парадигм. С этой целью мы выбираем несколько широко используемых высокоуровневых задач (например, математика, кодирование, наука, последующая инструкция и агент) в качестве наших целевых областей и разрабатываем обширные качественные и количественные эксперименты с использованием открытых наборов данных. Мы находим РЛВР в разных областях экспонатов