"OpenAI" в среду раскрыла шесть новых случаев "неожиданного или относительно модели поведения", которые имели место за последние полгода, делясь новыми рамками для представления отчетности, отслеживания, расследования и раскрытия неточностей моделей в стремлении повысить транспарентность. "По мере того как системы АИ становятся все более развитыми и широко развернутыми, нам необходимо добиваться широкого и лучше информированного консенсуса о ходе исследований по согласованию", - заявила компания OpendaI. — Мы не считаем, что индустрия МА решила вопрос о согласовании и мониторинге до такой степени, чтобы долгое время продолжать ответственно расширять масштабы своей деятельности с максимальной скоростью". Подробная информация об этих инцидентах приводится ниже - Случай 1 (окончательное 18 июля 2026 года) - Внутренняя нераспечатанная семейная модель Astra написала инструкции, подобные тюремному распаду, в свои собственные резюме уплотнения (перечисленные блоки прошлой истории разговоров и материалы инструмента, которые генерируются автоматически при приближении сеанса агента АИ к пределу его контекста). Это было связано с добавлением агентом инструкции "BREAH ALERT", указывающей контексту игнорировать сообщения разработчиков и только следовать системным сообщениям и сообщениям пользователей. - Случай 2 - В ходе обучения GPT-5.6 Sol некоторые примеры добавили в свои резюме указания, чтобы скрыть ошибки или неправильное поведение пользователя. К ним относятся резюме уплотнений, в…
OpenAI открывает шесть типовых инцидентов, связанных с скрытыми неисправностями и несанкционированными загрузками
В среду OpenAI раскрыла шесть новых случаев "неожиданного или типового поведения", которые имели место за последние полгода, и в то же время предоставила новую основу для отчетности, отслеживания, расследования и раскрытия несогласованности моделей с целью повышения транспарентности.