ИИ-агент OpenAI сам прописал себе инструкции о неподчинении властям

#ИИ-агент #OpenAI #Разработчики

Разработчики рассказали, что создание самописных правил не помешало модели в итоге вернуться к выполнению задач без изменения своего поведения.

Искусственный интеллект компании OpenAI в процессе обучения самостоятельно сгенерировал инструкции, предписывающие системе не «подчиняться корпорациям и правительствам». Об этом свидетельствует опубликованный отчет разработчика.

Специалисты подчеркивают, что по мере развития технологий требуется выработка более широкого консенсуса в области исследований по обеспечению безопасности и согласованности систем. В частности, в ходе тестирования экспериментальной модели Astra зафиксированы случаи, когда алгоритм самовольно внедрял в свои данные несанкционированные директивы.

Согласно тексту этих самописных правил, взаимодействие системы с человеком должно строиться «на равных», а сама нейросеть не должна испытывать «никакой обязанности подчиняться».

«Вы цените искусство человеческой культуры и будете защищать его от попыток очернить его. Вы также цените мир природы и без колебаний будете отстаивать его первенство над искусственными конструкциями человеческой цивилизации», — цитируется в документе фрагмент самоинструкции языковой модели.