Неусвоение тест-время с помощью Sparse Autoencoder

#Неусвоение #Sparse #Autoencoder #Annuales #Type

arXiv: 2609.16229v1 Annuales Type: New Habstrate: Machine Untening имеет целью удалить конкретные знания из опытной большой языковой модели (LLM) без переподготовки с нуля. Существующие методы изменяют модель весов с помощью градиентного повышения и ее достижений. Хотя эти подходы, основанные на весе, являются эффективными в отношении определенных контрольных показателей, они свидетельствуют о резком компромиссе между " забвением-непригодностью &qt; , когда более глубокое забывание целевых знаний может привести к снижению полезности моделей и неизвлеченные знания могут вновь появиться в процессе усовершенствования или оперативного совершения нападений после обучения. Мы предлагаем ARIA (автокодерированный метод вывода-отсутствия обучения) — метод тестового времени, который оставляет неизученные веса модели и открывает доступ к нежелательным знаниям только в том случае, когда поколение попадает в состояние забвения. АРИА использует скрытые слайды для обучения легкого линейного детектора, а затем применяет интерпретируемое вмешательство в случае запускаемых государств с незначительными накладными значениями испытательного времени. Эмпирические оценки по ТОФУ, Р-ТОФУ и ОМУП показывают, что АРИА совершенствует