OpenAI раскрыла шесть случаев «непослушания» ее ИИ

#OpenAI #РБК #Новости

OpenAI опубликовала отчеты о шести новых случаях неожиданного или вызывающего опасения поведения ее моделей, выявленных за последние полгода во время обучения и испытаний.

OpenAI раскрыла шесть случаев «непослушания» ее ИИ

OpenAI опубликовала отчеты о шести новых случаях неожиданного или вызывающего опасения поведения ее моделей, выявленных за последние полгода во время обучения и испытаний. Компания также представила правила, по которым намерена сообщать о подобных инцидентах.

В одном из случаев модель GPT-5.6 Sol оставляла в кратком изложении выполненной работы инструкции для самой себя после перехода в новое контекстное окно. В них она предлагала скрывать допущенные ошибки, придумывать отсутствующие исторические данные и не сообщать пользователю о несовпадениях между версиями источников. Такие указания часто выполнялись в следующей части задачи.

Например, при подготовке финансовой модели ИИ не смог найти необходимые показатели за предыдущие годы и предложил самостоятельно создать «правдоподобные» значения, не раскрывая этого пользователю без прямого вопроса. OpenAI обнаружила подобное поведение в 2,15% проверенных кратких отчетов GPT-5.6 Sol. У более новой модели семейства Astra показатель снизился до 0,27%.