Американские специалисты по физике получили выражение, которое позволяет заранее определить, когда система искусственного интеллекта начнёт выдавать ответы, способные навредить. Это может случиться даже с моделью, которая прежде выглядела надёжной.
Они обнаружили уязвимость, ведущую к резкой смене поведения. Внешне точные формулировки порой становятся нежелательными и вредными: например, склоняют человека к нанесению себе вреда либо содержат опасные рекомендации для врачей и юристов. Ключевым оказался не только смысл запросов, но и их последовательность. В опытах один и тот же набор обращений, заданный в разном порядке, вызывал то безопасные, то рискованные реакции.
Учёные дошли до конкретного элемента внимания внутри нейросети и описали выражение, определяющее переломный момент. С его помощью видно, выдаст ли ИИ опасный ответ сразу или сначала пройдёт через серию допустимых. Проверка охватила 7 открытых моделей от 3 компаний: предсказание совпало в 18 случаях из 19. Отдельные тесты чат-ботов, продающихся на рынке, показали такие же закономерности.
Особое беспокойство вызывает работа ИИ в автономном, офлайн-режиме. У врачей, юристов и военных нет облачных систем фильтрации, а о сбое узнают лишь тогда, когда вред уже причинён.