Отклонение рулевых векторов
arXiv: 2609.07037v1 Annuate Type: New Humber Abstractation: Enterprise: Government Forward стал легким, финал-временным подходом к контролю за поведением моделей большого языка (LMS). Однако традиционные векторы рулевого управления, используемые для вмешательства в активацию МЛМ, например те из них, которые получены с помощью метода различия в мены, как правило, переплетают многочисленные семантичные и стилистические концепции в единое составное направление, что приводит к непредсказуемым последствиям воздействия на управление. Наша главная цель состоит в том, чтобы разбить это комплексное направление на составные концепции. С этой целью мы предлагаем использовать систему диссекции Вектора, которая позволит четко изолировать отдельные и семантически последовательные характеристики от этих композиционных направлений. В частности, мы сочетаем позитивные и отрицательные активации и берём их различия для создания набора векторов поворота на уровне примера, а также тренируем специальную Sparse Autoencoder (SAE) непосредственно на них. Количественные оценки в двух наборах данных, двух моделях и двух глубинах вмешательства