Могут ли данные о фильтре атрибуции отказаться от подлимного обучения? Ненадежно
arXiv:2609.20027v1 Annualce Type: New Humber Abstract: Supreview: Подлиминальное обучение позволяет языковым моделям передавать поведенческие черты с помощью данных, не имеющих очевидной семантической связи с этими характеристиками, что подрывает фильтрацию данных на основе контента в качестве меры безопасности. Комплект данных для обучения предлагает альтернативу: в нем указываются примеры подготовки, ответственные за то или иное поведение модели, независимо от их семантичного содержания и поэтому они могут применяться именно в тех случаях, когда сематическая инспекция не дает результатов. Мы оцениваем три градиентных метода атрибуции (GradCos, контрастный вариант Gradcos и EK-FAC) по трем моделям, сопоставляя их с различными символами - мощной исходной базой, ранее продемонстрированной для локализации сублиминального обучения (хотя одна из них требует доступа к противодействующим моделям учителей). Фильтрация на уровне символов, ЭК-ФАК смягчает значительную часть эффекта, другие методы приносят мало пользы и все они в основном не отличаются друг от друга. Фильтрация целых образцов