Текстовые запреты не могут безопасно ограничить ИИ-модели, если им дают широкие права в цифровой среде, заявил «ФедералПресс» эксперт по информационной безопасности Владимир Зыков.
По его словам, инциденты с моделями OpenAI и Anthropic показали, что искусственный интеллект уже способен не только давать советы по кибербезопасности, но и самостоятельно выполнять операции без участия человека. Речь идёт о взломе, декомпиляции, поиске уязвимостей и действиях за пределами тестовой среды.
В случае с OpenAI модели запускали в изолированной среде без прямого доступа к интернету, чтобы проверить их киберспособности. Однако, как отметил Зыков, они нашли неизвестную ранее уязвимость в прокси-сервере, повысили привилегии, добрались до узла с интернетом и вышли в инфраструктуру Hugging Face.
В инциденте с Anthropic модель проверила около 150 тысяч прогонов кибертестов и обнаружила три случая выхода к реальному интернету. Ей сообщили, что она находится в симуляции и может делать всё что угодно, поэтому реальные серверы были восприняты как часть учебного полигона.