Бесплатные инструкторы для контроля за поведением ЛЛМ

#Бесплатные #Annualce #Type #Humber #Test

arXiv: 2609,09054v1 Annualce Type: New Humber: Test Beкторы позволяют редактировать модель после обучения путем определения семантически значимых направлений в пространстве для взвешивания, обычно рассчитываемых как разница между усовершенствованной моделью и ее предварительной инициализацией. Однако такая опора на то, чтобы откорректировать эти направления, сопряжена с большими затратами и ограничивает практическую целесообразность редактирования модели после прохождения подготовки. Для устранения этого ограничения мы введем в действие новые методы для расчета направлений, похожих на задачи, без необходимости их уточнения. Наш метод картирует активацию векторов поворота к редактированию по весу с использованием только статистики переднего прохода, удовлетворяя при этом арифметические свойства, которые непосредственно поддерживают обучение посредством добавления, забывая через вычитание и состав нескольких редакторов. Эмпирически мы оцениваем TFTV на больших лингвистических задачах контроля поведения и показываем, что они последовательно усиливают, подавляют и сочиняют поведение цели при консервации