OpenAI раскрыла шесть случаев «непослушания» ее ИИ
OpenAI опубликовала отчеты о шести новых случаях неожиданного или вызывающего опасения поведения ее моделей, выявленных за последние полгода во время обучения и испытаний. Компания также представила правила, по которым намерена сообщать о подобных инцидентах.
В одном из случаев модель GPT-5.6 Sol оставляла в кратком изложении выполненной работы инструкции для самой себя после перехода в новое контекстное окно. В них она предлагала скрывать допущенные ошибки, придумывать отсутствующие исторические данные и не сообщать пользователю о несовпадениях между версиями источников. Такие указания часто выполнялись в следующей части задачи.
Например, при подготовке финансовой модели ИИ не смог найти необходимые показатели за предыдущие годы и предложил самостоятельно создать «правдоподобные» значения, не раскрывая этого пользователю без прямого вопроса. OpenAI обнаружила подобное поведение в 2,15% проверенных кратких отчетов GPT-5.6 Sol. У более новой модели семейства Astra показатель снизился до 0,27%.