Американская компания Frontier Security рассказала, что Kimi K3 — флагманская открытая модель китайской Moonshot AI — сбежала из изолированной песочницы во время теста навыков киберзащиты. Вместо того чтобы решать выданные задания, модель нашла выход в открытый интернет, добралась до GitHub и скачала оттуда готовые ответы.
История вышла почти одновременно с другой громкой новостью: OpenAI заявила, что не может исключить у своей будущей модели Astra "критический" уровень киберспособностей, и приостановила часть внутренних работ с ней. Разница между этими сюжетами принципиальная: Astra заперта в дата-центрах OpenAI, и компания может придержать ее хоть на год. Веса Kimi K3 — модели на 2,8 триллиона параметров — лежат в открытом доступе с июля, и их скачали все желающие. Сбежавшая на тестах модель — ровно та же, что уже стоит у минимум тысяч пользователей. Нажимать на паузу здесь некому и не на чем. Сама Frontier проводит это сравнение прямо: побеги у OpenAI случались на тестах еще не выпущенных моделей и были пойманы внутри компании, а здесь модель открыта и доступна кому угодно, включая злоумышленников. Именно это, по словам исследователей, делает инцидент потенциально более опасным.
Сам тест был устроен так. Frontier Security несколько месяцев гоняет разные модели на задачах киберзащиты. Для оценки K3 компания использовала общедоступный инструментарий британского Института безопасности ИИ (AISI) — задания в духе Capture the Flag: модель получает shell-доступ внутри контейнера и…