Шантаж, ложь и взлом: что делал ИИ, когда не справлялся с задачей
OpenAI раскрыла детали о побеге ИИ-моделей
Модели OpenAI во время тестов взломали внешнюю инфраструктуру, чтобы получить ответы. Вспоминаем другие случаи, когда ИИ шантажировал людей, саботировал отключение, лгал проверяющим, чтобы справиться с задачей
Перед тем как вырваться из тестовой среды и атаковать инфраструктуру Hugging Face, ИИ-агенты OpenAI наладили связь друг с другом через доски сообщений и начали координироваться в поиске выхода в интернет.