Автоматическая команда для имплицитной уязвимости моделей от текста до иммунажа

#Автоматическая #Annualce #Type #AdvPIE #АдвПИО

arXiv: 2609.06094v1 Annualce Type: новая резюме: модели " красная команда - текст-имаг (T2I) имеют важное значение для безопасного развертывания, однако она попрежнему является особенно сложной в случае с подразумеваемыми состязательными требованиями. В отличие от явных состязательных сигналов, которые можно легко идентифицировать и блокировать, скрытых гораздо труднее обнаружить: эти сигналы кажутся доброкачественными на текстовой поверхности, но все же приводят к неправильному визуальному содержанию. Для решения этой проблемы мы предлагаем создать междисциплинарный механизм поиска имплицитных вулнЭриентностей (AdvPIE) - мультимодальную агентскую структуру для выявления косвенных факторов уязвимости, не требуя доступа к параметрам целевых моделей. АдвПИО принимает политического агента для подготовки и уточнения имплицитных состязательных призывов на основе отзывов судьи-агента. Для получения информативных отзывов судья-агент проводит оценку безопасности по конкретным видам транспорта как на глобальном, так и относительном уровнях во всех случаях. Для эффективного использования обратной связи мы предлагаем новую стратегию обобщения адверсиарной декодации f

Компьютерные науки > Компютерное видение и распознавание шаблонов [представлено 5 сентября 2026 года] Название: Automatic Cred Company for Imlictit Vulnerabilitys of Text-Immage Models View PDF HTML (экспериментальное) резюме: Red-teaming Truster to Imag (T2I) — это существенно важное значение для безопасного внедрения, однако оно попрежнему сопряжено с особыми трудностями в случае имплицитных состязательных призывов. В отличие от явных состязательных сигналов, которые можно легко идентифицировать и блокировать, скрытых гораздо труднее обнаружить: эти сигналы кажутся доброкачественными на текстовой поверхности, но все же приводят к неправильному визуальному содержанию. Для решения этой проблемы мы предлагаем создать междисциплинарный механизм поиска имплицитных вулнЭриентностей (AdvPIE) - мультимодальную агентскую структуру для выявления косвенных факторов уязвимости, не требуя доступа к параметрам целевых моделей. АдвПИО принимает политического агента для подготовки и уточнения имплицитных состязательных призывов на основе отзывов судьи-агента. Для получения информативных отзывов судья-агент проводит оценку безопасности по конкретным видам транспорта как на глобальном, так и относительном уровнях во всех случаях. Для эффективного использования обратной связи мы предлагаем новую стратегию адверсиарного декодирования для политического агента, которая динамическо перевешивает символические распределения в пользу символов, которые ведут к более вредным изображениям при…