Оптимизация прямых предпочтений бесперебойного использования
arXiv:2602.00931v3 Тип уведомления: заменить перекрестное резюме: аргументация с использованием большой языковой модели часто рассматривается как монолитная способность, полагающаяся на двоичный надзор за преференциями, который не позволяет отразить частичный прогресс или мелкозернистые логические качества. Мы внедряем непрерывную оптимизацию прямых предпочтений в сфере коммунальных услуг (КУ-ДП), рамочную систему, которая увязывает модели с портфелями оперативных когнитивных стратегий путем замены двоичной маркировки на постоянные баллы, которые отражают качество мелкозернистых рассуждений. Мы доказываем, что обучение с помощью стратегий K дает тету (K log K) повышение сложности выборки по сравнению с двоичными преференциями и что DPO конвергентирует политику энтропии-упорядоченной полезности-максимумизации. Для того чтобы использовать этот сигнал, мы предлагаем двухэтапный трубопровод: i) выбор стратегии, который оптимизирует модель для выбора наилучшей стратегии на основе сопоставления наилучших vs-всех и ii) совершенствование исполнения, что позволяет правильно осуществлять программу с использованием пар, стратифицированных по марже. Рамки являются доменами: любая задача а