О интерпретируемости кодировок Шепота с использованием Sparse Autoencoders
arXiv:2605.12225v3 Annualce Type: заменить резюме: Хотя модели на основе глубоких трансформаторов быстро развиваются, их внутренние механизмы остаются в основном загадкой. В последнее время приоритетное внимание уделяется пониманию текстовых моделей трансформаторов, в результате чего системы АСР остаются практически неисследованными. Для того чтобы устранить этот пробел, мы изучаем внутреннее представление заклинателя Веппера с помощью слабого автоенкодера. Мы находим различные моносемантические черты в лингвистических и нелингвистических границах, охватывающие иерархию от словесных до семантических представлений, и проводим кампанию по обеспечению причинно-следственной связи между элементами этой иерархии, включая управление на разных языках. Мы также считаем, что рулевое управление является более надежным для элементов более высокого уровня по сравнению с элементами более низкого уровня - асимметрия, которая может отражать избыточную кодификацию информации нижнего уровня. В целом эта работа показывает, что заклинание Шепца представляет собой удивительно богатую иерархию языковой информации, которая выходит далеко за рамки строго необходимой.