Переписать агент для Stabile Off-Policy SFT
arXiv: 2602,1220v2 Annualection Type: заменить резюме: крупные языковые модели обычно адаптируются к заданиям вниз по течению с помощью контролируемой доработки (SFT), однако существенное несоответствие между контролем ниже по течении и распределением поколения моделей может усилить катастрофический забвение. Переписка данных предлагает ориентированный на данные способ сузить это несоответствие до СФТ. Однако существующие методы, как правило, переписываются из быстро вызванного условного распределения, которое не обязательно должно соответствовать естественному распределению ответов на вопросы поколения, а фиксированные шаблоны могут уменьшить разнообразие выпуска. Мы формулируем переформулирование данных в качестве проблемы обучения политике и готовим политику легкой переписки LORA с усиленным обучением. Эта политика оптимизирует согласование ответов на вопросы и семантическое разнообразие под жесткими задачами, обеспечивая проверяемый контроль за деятельностью по линии СФТ. Через три позвоночника, построенные на инструкциях, полученные модели в тайском режиме