САЕСУНИЧЕСКИЙ БЕНХ: Могут ли АИ-агенты проводить независимые исследования интерпретируемости САЕ?
arXiv: 2609.09113v1 Аннонс Тип: перекрестное резюме: В то время как исследования по рекурсивному самосовершенствованию (RSI) имеют преимущественно автоматизированные учебные трубопроводы с использованием моделей, для надежного автономного развития требуется отсутствующий столп: постспециальный мониторинг и аудит для понимания того, какие модели учатся и обеспечивают безопасное согласование. Для преодоления этого пробела необходимы механистические средства толкования, среди которых Спарсе Автогендодеры (САЕ) служат краеугольным камнем путем изолирования интерпретируемых характеристик для проверки моделей и рулевого управления. В этом документе мы представляем SAESacientist-Bench для оценки того, могут ли агенты AI выступать в качестве ученых с использованием инструментов SAE для автономного механистического открытия. С учетом концепции цели агент проектирует контрастные зонды и использует словарь Gemma Schople, содержащий 131K+ параметров в Gemma-2-9B-IT, для выявления оптимальной функции, оцениваемой с помощью кумулятивных справочных функций экспертов на основе нейронпедии по ряду позиций активации, концептуальной селективности контрастных текстов и причинно-следственного управления. Через