Реклама

Обучение атаке и защите: Адаптивная красная комбинация языковых моделей с помощью GPO

#Обучение #Адаптивная #Annuature #Type #Резюме

arXiv: 2606.097001v2 Annuature Type: заменить Резюме: Безопасность языков должна постоянно адаптироваться к возникающим атакам. Недавние работы показали, что дополнительное обучение может быть использовано для подготовки более сильных моделей нападавших и защитников в тандеме путем применения самопроигрывания по типу PPO и оптимизации предпочтений по стилю DPO. В этой работе мы изучаем эффективность ГРП в этих условиях. Совместная подготовка может быть сопряжена с трудностями, поскольку она требует совместной оптимизации многочисленных свойств как нападающего, так и защитника. Таким образом, мы формируем результаты модели с использованием многочисленных каналов поощрения на основе судей ЛМ и вычисляем преимущества с UPSO, что не позволяет любому одному каналу доминировать. В нашем методе используется учебная программа, которая переходит от одноразового и многооборотного обучения к совместной подготовке, в рамках которой модели нападавшего и защитника обновляются при чередовании. Мы показываем, что этот метод приводит к весьма эффективным и поддающимся передаче нападениям и что совместно подготовленные защитники достигают конкурентной безопасности в период предварительного заключения

Компьютерные науки > Расчеты и язык [представлен 8 июня 2026 (v1), последний пересмотренный вариант 7 октября 2026 года (эта версия, v2)) Название: " Учеба для атаки и защиты: Адаптационная красная комбинация языковых моделей через GPO View PDF HTML (экспериментальное резюме): Безопасность Language Model должна постоянно адаптироваться к возникающим атакам. Недавние работы показали, что дополнительное обучение может быть использовано для подготовки более сильных моделей нападавших и защитников в тандеме путем применения самопроигрывания по типу PPO и оптимизации предпочтений по стилю DPO. В этой работе мы изучаем эффективность ГРП в этих условиях. Совместная подготовка может быть сопряжена с трудностями, поскольку она требует совместной оптимизации многочисленных свойств как нападающего, так и защитника. Таким образом, мы формируем результаты модели с использованием многочисленных каналов поощрения на основе судей ЛМ и вычисляем преимущества с UPSO, что не позволяет любому одному каналу доминировать. В нашем методе используется учебная программа, которая переходит от одноразового и многооборотного обучения к совместной подготовке, в рамках которой модели нападавшего и защитника обновляются при чередовании. Мы показываем, что этот метод приводит к весьма эффективным и поддающимся передаче нападениям и что совместно подготовленные защитники достигают конкурентной безопасности при сохранении общей полезности. С помощью контролируемой абляции мы далее выясняем, какие…