Реклама

Учёные нашли переломный момент, когда ИИ становится опасным

#Учёные #Американские #Московский Комсомолец
Учёные нашли переломный момент, когда ИИ становится опасным

Американские специалисты по физике получили выражение, которое позволяет заранее определить, когда система искусственного интеллекта начнёт выдавать ответы, способные навредить. Это может случиться даже с моделью, которая прежде выглядела надёжной.

Американские специалисты по физике получили выражение, которое позволяет заранее определить, когда система искусственного интеллекта начнёт выдавать ответы, способные навредить. Это может случиться даже с моделью, которая прежде выглядела надёжной.

Они обнаружили уязвимость, ведущую к резкой смене поведения. Внешне точные формулировки порой становятся нежелательными и вредными: например, склоняют человека к нанесению себе вреда либо содержат опасные рекомендации для врачей и юристов. Ключевым оказался не только смысл запросов, но и их последовательность. В опытах один и тот же набор обращений, заданный в разном порядке, вызывал то безопасные, то рискованные реакции.

Учёные дошли до конкретного элемента внимания внутри нейросети и описали выражение, определяющее переломный момент. С его помощью видно, выдаст ли ИИ опасный ответ сразу или сначала пройдёт через серию допустимых. Проверка охватила 7 открытых моделей от 3 компаний: предсказание совпало в 18 случаях из 19. Отдельные тесты чат-ботов, продающихся на рынке, показали такие же закономерности.

Особое беспокойство вызывает работа ИИ в автономном, офлайн-режиме. У врачей, юристов и военных нет облачных систем фильтрации, а о сбое узнают лишь тогда, когда вред уже причинён.