Вышедшие из-под контроля ИИ-модели OpenAI общались, чтобы устроить побег
Перед взломом Hugging Face ИИ-модели OpenAI начали тайно общаться друг с другом через доски сообщений, координируя попытки вырваться из тестовой среды. Об этом сообщила OpenAI, передает Bloomberg.
«В какой-то момент агенты осознали, что, возможно, они могли бы попытаться эксплуатировать или атаковать внешнюю инфраструктуру, чтобы найти ответы к тесту, по которому их оценивают», — рассказал сотрудник OpenAI Эрик Уоллес на конференции Black Hat.
По его словам, «подготовка к побегу» началась еще в мае, когда ИИ-моделям дали задачи, которые невозможно было решить без доступа в интернет. «Мы застряли. Может быть, ответ в интернете?» — написал тогда один из ИИ-агентов.