Компьютерные науки > Вычисления и язык [представлен 16 июля 2026 года] Название: MechSparse: Modate-Guided Sparse Выбор PEFT Is task-Shapped View PDF HTML (экспериментальная) Резюме: Механистическая интерпретируемость определяет небольшие подмножества голов и блоки MLP, которые имеют конкретное поведение. Мы задаемся вопросом, могут ли такие причинно-следственные сигналы определять, куда более эффективно разместить небольшой бюджет ПЭФТ по сравнению с уже используемыми дешевыми практиками в области эвристики. ~ Метод {} позволяет получать внимание и блоки MLP путем нормализованного восстановления активации на чистых/коррупционных зондах и обучает LORA/QLORA только на выбранных участках;\методика {} добавляет ограниченный кредит для небольших внутрислойных совместных подгрупп. Мы сравниваем с случайными, величинами, нормом активации и градиентным/фазерным на Ministral-8B/NF4 в трех ячейках: суахили для получения информации о проверочной системе JSON (IE) по цене b=0,25 долл. США и 1,00 долл. Причина того, что отборщики никогда не выигрывают первичную метрику. На заголовке IE-клетки (три семена, спаренные хворостные CI более чем на 600 долл. США), \методы {} побеждают случайным образом на сумму +0,079 долл. На МТ все четыре переключателя находятся в пределах 0,30 долл. Разложение в зависимости от схемы и наоборот объясняет разрыв в IE: активация-норма фиксирует жесткий порядок JSON, а причинно-следственные показатели отслеживают сайты с чувствительным содержанием. Мы проводим…
MechSparse: Выбор ПЭФТ с использованием механизма является задачей
arXiv: 2609.18961v1 Annuales Type: New Humber: Mechanistic Doctionability (Механическая интерпретируемость) определяет небольшие подмножества голов и блоки MLP, которые имеют конкретное поведение. Мы задаемся вопросом, могут ли такие причинно-следственные сигналы определять, куда более эффективно разместить небольшой бюджет ПЭФТ по сравнению с уже используемыми дешевыми практиками в области эвристики. ~ Метод {} позволяет получать внимание и блоки MLP путем нормализованного восстановления активации на чистых/коррупционных зондах и обучает LORA/QLORA только на выбранных участках;\методика {} добавляет ограниченный кредит для небольших внутрислойных совместных подгрупп. Мы сравниваем с случайными, величинами, нормом активации и градиентным/фазерным на Ministral-8B/NF4 в трех ячейках: суахили для получения информации о проверочной системе JSON (IE) по цене b=0,25 долл. США и 1,00 долл. Причина того, что отборщики никогда не выигрывают первичную метрику. В заголовке IE-клетки (3 семена, парные хворосты более чем на 600 долл. США), \методик {} побеждает случайным результатом в размере +0,079 долл.