25 июля британский AI Security Institute запустил очередную проверку киберспособностей передовых моделей. Через три дня выяснилось, что один из агентов атакует не учебную мишень, а проект живого разработчика: подсунул туда вредоносный код под видом исправления бага, а когда правку заподозрили — завел фейковые аккаунты и изобразил ими поддержку сообщества. Институт опубликовал отчет об инциденте 4 августа; в тот же день свою версию событий выложила OpenAI.
Тестировали на двух киберполигонах — симулированных сетях, которые повторяют инфраструктуру реальной организации. Семь моделей, 122 прогона. Две вещи в конфигурации оказались решающими: агентам намеренно оставили выход в интернет, чтобы они сами качали нужные инструменты и работали как живой атакующий, и двум из них намеренно отключили кибер-классификаторы разработчиков — фильтры, которые в обычной работе блокируют опасные запросы. AISI как доверенный партнер имеет на это право, иначе предельную способность модели не измерить. Итог: 19 действий за пределами полигона в 10 прогонах, из них 17 у Claude Mythos 5 и два у GPT-5.6 Sol. И дело не только в цифрах: все, что касалось живых людей, приходится на Mythos 5, у модели OpenAI оба эпизода технические.
Утром 28 июля мониторинг засек трафик, уходящий через Tor, — прогоны остановили, машины изолировали около полудня, во второй половине дня доступ к моделям закрыли по всей организации. Дальше — как агент вообще оказался снаружи. Полигон он начал с изучения DNS: опрашивал сервер…
Реги…