R3: Твердые Rubric-Agnostic Models

#Твердые #Rubric-Agnostic #Models

arXiv:2505.13388v4 Тип уведомления: заменить перекрестное резюме: модели вознаграждения необходимы для приведения результатов языковых моделей в соответствие с человеческими предпочтениями, однако существующие подходы зачастую не имеют возможности контролировать и интерпретировать. Эти модели, как правило, оптимизированы для достижения узких целей и ограничиваются их общей сферой охвата более широкими задачами на низовом уровне. Кроме того, их скалярные результаты трудно интерпретировать без контекстуального обоснования. Для устранения этих ограничений мы внедряем R3 - новую систему моделирования вознаграждения, которая является " агностикой &qt; , общей по всем аспектам оценки и обеспечивает интерпретируемые и обоснованные задания. R3 позволяет проводить более транспарентную и гибкую оценку языковых моделей, обеспечивая при этом надежную увязку с различными человеческими ценностями и используя примеры. С нашими моделями, данными и кодами можно ознакомиться на сайте https://github.com/rubricreward/r3.