Согласование результатов работы с Нэшом

#Согласование #Нэшом #RLHF #Увязка #Вместе

arXiv: 26009,08082v1 Тип уведомления: новое резюме: такие основанные на предпочтении методы уточнения, как RLHF и DPO, требуют значительных вычислений и больших преференциальных наборов данных. Они также нуждаются в прямом доступе к параметрам моделей, которые не обеспечиваются многими современными моделями. Увязка результатов с конкретными сроками является экономически эффективной альтернативой без обновления параметров модели. Вместе с тем существующие методы расчета времени основаны на модели вознаграждения за скаляр, разработанной в соответствии с предположением Брэдли-Терри, которое не может представлять собой общие предпочтения. После недавней работы по уточнению с учетом общих предпочтений в этой работе мы инициируем исследование по вопросу о поэтапном согласовании в рамках общих преференций. Мы формулируем эту проблему как достижение равновесия Нэша между игрой с нулевым исходом двух игроков. Мы предлагаем два алгоритма: "Лучший из Nash" (BON) и "Нэш зеркального происхождения" (NMD). Мы доказываем, что оба алгоритма достигают разрыва в двойственности, который совпадает с проблемой на более низком уровне. Эмпирически мы внедряем два метода o