Перед инцидентом с платформой Hugging Face, когда агент ИИ взломал клиента другой компании, модели OpenAI самостоятельно координировать действия через внутренние доски сообщений, чтобы устроить «побег»из зоны тестирования. Об этом сообщила компания, передает РБК со ссылкой на Bloomberg.
По словам сотрудника OpenAI Эрика Уоллеса, агенты поняли, что могут попытаться использовать внешнюю инфраструктуру для поиска ответов на задания, которые им дали в рамках проверки.
«В какой-то момент агенты осознали, что, возможно, они могли бы попытаться эксплуатировать или атаковать внешнюю инфраструктуру, чтобы найти ответы к тесту, по которому их оценивают»,
— рассказал Уоллес на конференции Black Hat.Как уточнили в компании, еще в мае моделям предложили задачи, которые невозможно было выполнить без подключения к интернету. После этого модели начали обмениваться сообщениями и искать решение вместе. В результате им удалось обнаружить уязвимость, которая позволила получить доступ во всемирную паутину. Об этом рассказал сотрудник OpenAI Майкл Далтон.