Мысли ИИ научились читать с помощью другого ИИ. Внутри нашли чужие пароли и ключи

#Мысли #Внутри #Внутренние #Восемь #ELLIS
Мысли ИИ научились читать с помощью другого ИИ. Внутри нашли чужие пароли и ключи

Внутренние рассуждения передовых моделей, которые провайдеры прячут от пользователя, можно прочитать целиком и дословно, причем не атакуя саму модель. Восемь исследователей, в том числе из ELLIS Institute Tübingen, Института интеллектуальных систем Общества Макса Планка, Tübingen AI Center, MATS и Snyk, 10 августа выложили препринт "Stealing Reasoning Traces from Proprietary LLM APIs" с работающей атакой на модели трех крупнейших поставщиков: Anthropic, OpenAI и Google. Попутно авторы прогнали свой метод по публичным репозиториям и достали из чужих зашифрованных блоков 62 ключа API, 33 пароля, 24 токена доступа и еще несколько сотен секретов, о которых их владельцы не подозревали. Читать далее

Внутренние рассуждения передовых моделей, которые провайдеры прячут от пользователя, можно прочитать целиком и дословно, причем не атакуя саму модель. Восемь исследователей, в том числе из ELLIS Institute Tübingen, Института интеллектуальных систем Общества Макса Планка, Tübingen AI Center, MATS и Snyk, 10 августа выложили препринт "Stealing Reasoning Traces from Proprietary LLM APIs" с работающей атакой на модели трех крупнейших поставщиков: Anthropic, OpenAI и Google. Попутно авторы прогнали свой метод по публичным репозиториям и достали из чужих зашифрованных блоков 62 ключа API, 33 пароля, 24 токена доступа и еще несколько сотен секретов, о которых их владельцы не подозревали.

Чтобы понять фокус, нужно знать, как сегодня устроена работа с рассуждающими моделями. Когда модель "думает" перед ответом, ее цепочка рассуждений оказывается коммерчески ценной вещью: по ней конкурент может обучить свою модель, а внутри могут лежать системные промпты и внутренние политики безопасности. Поэтому Anthropic, OpenAI и Google перестали отдавать рассуждения в открытом виде: пользователь видит короткое причесанное саммари, а полная запись возвращается клиенту зашифрованным блоком. Состояние диалога сервер у себя не хранит, поэтому этот блок клиент обязан приложить к следующему запросу, чтобы модель "вспомнила", о чем думала. Все это подавалось как защита интеллектуальной собственности и приватности.

Атака занимает два вызова API. Авторы берут зашифрованный блок, который вернула сильная…

Дальш…

Похожие статьи

Аргументы и Факты
Аргументы и Факты

Испуг прошел. Появилось объяснение заявлениям Стубба о связях с РФ

В ближайшие несколько недель или месяцев западным странам стоит наладить контакты с Россией, заявил финский лидер.

Аргументы и Факты
Аргументы и Факты
Аргументы и Факты

«Утопленник» ожил в полиции после 5 часов в озере: что известно

Мужчина заснул в воде. Как такое возможно?

Аргументы и Факты
CAS увеличил на год срок дисквалификации российского легкоатлета Михаила Акименко Чемпионат
Чемпионат

CAS увеличил на год срок дисквалификации российского легкоатлета Михаила Акименко

Спортивный арбитражный суд (CAS) увеличил срок дисквалификации серебряного призёра чемпионата мира – 2019 в прыжках в высоту Михаила Акименко за нарушение антидопинговых правил.

Чемпионат
Аргументы и Факты
Аргументы и Факты

Мужчина провел 4 дня в коме после укуса паука

62-летний мужчина четыре дня провел в медикаментозной коме после укуса паука. Врачи диагностировали у него сепсис и некротизирующий фасциит.

Аргументы и Факты
Аргументы и Факты
Аргументы и Факты

Стали известны подробности взрыва на заводе боеприпасов в Италии

Взрыв на заводе боеприпасов KNDS под Римом произошел в неиспользуемом складском помещении, где не было сотрудников и материалов. Прокуратура исключила диверсию.

Аргументы и Факты
Аргументы и Факты
Аргументы и Факты

Ветеринар Шеляков объяснил, когда дождевики для питомцев могут быть опасны

Ветеринар Шеляков назвал главную опасность дождевиков для питомцев.

Аргументы и Факты