Внутренние рассуждения передовых моделей, которые провайдеры прячут от пользователя, можно прочитать целиком и дословно, причем не атакуя саму модель. Восемь исследователей, в том числе из ELLIS Institute Tübingen, Института интеллектуальных систем Общества Макса Планка, Tübingen AI Center, MATS и Snyk, 10 августа выложили препринт "Stealing Reasoning Traces from Proprietary LLM APIs" с работающей атакой на модели трех крупнейших поставщиков: Anthropic, OpenAI и Google. Попутно авторы прогнали свой метод по публичным репозиториям и достали из чужих зашифрованных блоков 62 ключа API, 33 пароля, 24 токена доступа и еще несколько сотен секретов, о которых их владельцы не подозревали.
Чтобы понять фокус, нужно знать, как сегодня устроена работа с рассуждающими моделями. Когда модель "думает" перед ответом, ее цепочка рассуждений оказывается коммерчески ценной вещью: по ней конкурент может обучить свою модель, а внутри могут лежать системные промпты и внутренние политики безопасности. Поэтому Anthropic, OpenAI и Google перестали отдавать рассуждения в открытом виде: пользователь видит короткое причесанное саммари, а полная запись возвращается клиенту зашифрованным блоком. Состояние диалога сервер у себя не хранит, поэтому этот блок клиент обязан приложить к следующему запросу, чтобы модель "вспомнила", о чем думала. Все это подавалось как защита интеллектуальной собственности и приватности.
Атака занимает два вызова API. Авторы берут зашифрованный блок, который вернула сильная…
Дальш…