CommonSAE: Единый словарь о характеристиках, используемый в моделях языка
arXiv: 2609.04344v1 Annuate Type: новый резюме: Sparse autoencoders (SAE) широко используется для интерпретации активаций языковых моделей, однако обучение и латентная маркировка SAE обычно повторяются по каждой модели. Здесь мы показываем, что один общий SAE может заменить коллекцию специально…