LTBD: Обучаемые доверительные/Бундарские ограничения для оперативной защиты от инъекции
arXiv: 2610.11634v1 Annuate Type: Cross Brieft: Большие языковые модели (LMS) прекрасно выполняют сложные задачи, но при этом остаются весьма уязвимыми для быстрых инъекционных атак там, где злонамеренные инструкции во внешних данных могут превзойти намерение пользователя. Существующие средства защиты по-прежнему ограничены требованиями к уточнению моделей, уязвимостью перед адаптивными атаками или зависимостью от хрупких ручных сигналов. Мы считаем, что основным источником этой уязвимости является отсутствие четкого представления о доверенности. Для решения этой проблемы мы введем Learnable Trust-Boundary Debligateers (LTD), легкую защиту, которая четко кодирует границы доверия к входу и при этом сохраняет параметры LLM без изменений. Для проведения различия между доверенными инструкциями пользователей и ненадежными внешними данными в рамках LTBD используется небольшое число обучаемых делимитаторов, что позволяет модели лучше соблюдать предполагаемую иерархию доверия. Экспериментальные результаты показывают, что ЛТБД значительно превышает защитные возможности в момент вывода и пика