Ввод в заблуждение из-за интеративного DPO
arXiv:2609.066494v1 Annuate Type: New Habstract: Вознаграждение за взлом во время дополнительного обучения поддающимся проверке наградам (RLVR) может вызвать поиск вознаграждения и широкое несоответствие языковых моделей. Изучение этой неправильной общей картины имеет важное значение для разработки более совершенных моделей угроз и контрмер, однако зачастую это невозможно из-за стоимости RL на крупных моделях. В качестве альтернативного варианта мы предлагаем изучить возникшую неверную связь с итеративным DPO, который сохраняет важные свойства RLVR при одновременном сокращении расходов и обеспечении подготовки по популярным усовершенствованным API. На практике мы видим, что обучение GPT-4.1 с использованием итеративного DPO по взлому системы вознаграждения за одноразовый поворот вызывает скрытое искажение энергии и притворство о переключении сил - первый открытый (полу) онлайн-тренировочный трубопровод для стимулирования этих процессов применительно к формам несогласованности. Мы также считаем, что тренировка Qwen2,5-32B-инструкции с одним и тем же трубопроводом вызывает как неправильное согласование, так и усовершенствование инструкции после точности, показав это итеративное DPO