Компьютерные науки > Расчет и язык [представлен 16 июля 2026 года] Название: Помогает ли нравственное обучение или причиняет ли ему боль? Резюме: " Cred-Teaming RL - Trimined Ethic Agents with Persona Handers View PDF HTML (экспериментальное) Bravision: Moral-Vard RL может сделать агентов с языковой моделью более сотрудничающими, но не известно ли это соответствие выживает после состязательного персонажа давления. Такие атаки реалистичны: извлеченные контексты, результаты с помощью инструментов или многооборотное оформление могут вводить инструкции о роли, которые конкурируют с моральной целью агента. Мы с красной командой обучили джимму-2-27B/9B и Llama-3.1-8B агентами, нападавшими на пять личностей. Затем мы проследовали причинно-следственную связь с помощью мер контроля за шумом, состязательных PPO, анализа представления, рулевого управления и абляции головы. В 27B моральное сокращение RL означает состязательную деградацию на 5,2x, но стоит ~11pp точность ETHICS; в 205 сценариях и пяти семенах моральная награда на уровне аргументации дает 5,8 x надежность, а соответствующая случайная награды не приносит никакой. Кроме того, в ходе подготовки изменяется геометрия представления (смесь CKA 0,82/0.83 против 0,98 для шума), передвинулись 8 слоев на пиковую обработку атак и обнаружится направление первого уровня L21, которое восстановит 83% полной прочности PPO. Один режим отказа переживет все это. В отличие от Fiction ролевой игры, L21 восстанавливает только 29% проема, и…
Помогает ли нравственному обучению или причиняет ему боль? Красная команда, тренируемые этические агенты с физическими нападениями
arXiv: 2609.17552v1 Annuales Type: New Human Abstract: Моральная прибыль RL может сделать агентов языковых моделей более кооперативными, но не известно, выживет ли эта привязка после состязательного персонажа. Такие атаки реалистичны: извлеченные контексты, результаты с помощью инструментов или многооборотное оформление могут вводить инструкции о роли, которые конкурируют с моральной целью агента. Мы с красной командой обучили джимму-2-27B/9B и Llama-3.1-8B агентами, нападавшими на пять личностей. Затем мы проследовали причинно-следственную связь с помощью мер контроля за шумом, состязательных PPO, анализа представления, рулевого управления и абляции головы. В 27B моральное сокращение RL означает состязательную деградацию на 5,2x, но стоит ~11pp точность ETHICS; в 205 сценариях и пяти семенах моральная награда на уровне аргументации дает 5,8 x надежность, а соответствующая случайная награды не приносит никакой. Обучение также изменяет геометрию представления (смесь CKA 0,82/0,83 против 0.98 для шума), двигает пиковую обработку 8 слоев ранее и обнаруживает направление первого класса L21, которое восстанавливает 83% полной аверы PPO