Реклама

Визуальная память может напасть через кэш KV

#Визуальная #Annualce #Type #Системы #Может

arXiv: 2610,09027v 1 Annualce Type: кросс-бюллетень: Системы моделей современных языков функционируют автономно на все более длинных контекстах, содержащих ненадежные тексты и изображения. Может ли состязательный вклад продолжать управлять моделью даже после того, как эта информация будет удалена из ее контекста? Мы показываем, что атаки можно научить продолжать с помощью ключа/значимости (KV) последующих жетонов, позволяя состязательному влиянию пережить прямой доступ к источнику. Мы считаем Visual Memory Introduction (VMI; Schlarmann and Hein, 2026), в котором состязательный образ, остающийся в контексте, создает скрытое заднее отверстие: модель ведет себя нормально до тех пор, пока выбранный курок не вызовет реакцию нападающего-избранного. Сначала мы демонстрируем настойчивость в этой ситуации с оптимизированными мягкими сигналами, которые остаются эффективными после того, как мы скрываем от внимания их скорость. Затем мы введем стойкий Визуальный инжектор памяти (P-VMI), который оптимизирует изображения, чтобы сохранить это состязательное поведение после того, как они будут замаскированы с аттака.

Компьютерные науки > Криптография и безопасность [представлен 6 октября 2026 года] Название: Visual Memory Affairs Can Persist через KV Cache View PDF HTML (экспериментальное) Резюме: Модернизированные системы языков действуют автономно на все более длинных контекстах, содержащих ненадежные тексты и изображения. Может ли состязательный вклад продолжать управлять моделью даже после того, как эта информация будет удалена из ее контекста? Мы показываем, что атаки можно научить продолжать с помощью ключа/значимости (KV) последующих жетонов, позволяя состязательному влиянию переживать прямой доступ к этому адресу http://wise Memory Introduction (VMI; Schlarmann and Hein, 2026), в котором состязательный образ, остающийся в контексте создания скрытой задней двери: модель ведет себя нормально до тех пор, пока выбранный курок не вызовет реакцию нападающего-избранного. Сначала мы демонстрируем настойчивость в этой ситуации с оптимизированными мягкими сигналами, которые остаются эффективными после того, как мы скрываем от внимания их скорость. Затем мы введем стойкий Визуальный Инъекция памяти (P-VMI), который оптимизирует изображения для сохранения состязательного поведения после того, как они будут замаскированы от внимания. Эти нападения продолжаются в ходе разговоров значительно дольше, чем те, которые использовались во время оптимизации. В инструкции Qwen3-VL-8B P-VMI достигает примерно 90% успеха в своей самой сильной конфигурации и остается эффективным при более жесткой системе…