Исследовательская группа Epoch AI обновила лидерборд бенчмарка MirrorCode, добавив результаты новых флагманов Anthropic и OpenAI. Claude Fable 5 решил 64% задач, GPT-5.6 Sol — 20%. Разрыв втрое выглядит аномалией: на многих других тестах эти модели идут почти вровень, а кое-где Sol и вовсе впереди. Официального объяснения нет ни у Epoch, ни у Anthropic, но его можно восстановить по данным самого лидерборда.
MirrorCode — это бенчмарк, который Epoch AI разработала вместе с лабораторией METR. Идея такая: модель должна переписать целую программу с нуля, не видя ее исходного кода. Ей дают "черный ящик" — исполняемый файл, который можно только запускать, — документацию и видимую часть тестов. Программы настоящие и нетривиальные: потоковый редактор sed, линтер Ruff, утилиты биоинформатики, интерпретаторы языков, криптографические библиотеки, сжатие данных. Масштаб тоже настоящий: один из самых больших прогонов длился 19 дней автономной работы модели и стоил 2600 долларов.
Правила зачета жесткие. Решением считается только реализация, которая проходит 100% тестов — включая скрытые, которых модель не видит во время работы. Так авторы отсекают жульничество: подогнать вывод программы под известные тесты или собрать таблицу готовых ответов не получится, а интернет в песочнице отключен. В конфигурации лидерборда 15 программ среднего и большого размера, каждую нужно реализовать на двух языках, на попытку дается бюджет в 10 млрд токенов и 7 дней. Каждая задача прогоняется трижды.
Откуда же…