Всё, что нужно для разрыва МЛМ - это чёрный бокс. Адаптация, эффективность, передача, вредоносность, применение... Нападения
arXiv: 2606.03647v2 Тип уведомления: заменить перекрестное резюме: точная оценка состязательности является проблемой, которая существует уже давно. Несовершенство конструкции атаки может накачать оценки надежности, что делает ненадежную оценку риска развертывания и оборонное сопоставление. Исторически стандартизованные атаки, такие как AutoAttack, в значительной степени решили эту проблему для каталогов изображений, что обеспечило надежную основу оценки для систематического сопоставления по всем оборонам. Однако никакого эквивалента для оценки побегов из тюрьмы ЛЖМ пока не существует, когда разработка такого нападения сопряжена со значительными трудностями. Надежное нападение должно быть, среди прочего, совместимым с " черной коробкой &qt; , применимым к произвольным оборонительным трубопроводам и эффективным, что не соответствует ни одному из существующих методов. Мы введем в практику Оптимизацию косвенного вредного воздействия (МГО), нападавшего с помощью маскировочных диффузионных моделей языка, обученный посредством итеративной оптимизации предпочтений против судьи по вредоносности, что требует только доступа к мишени. Этот же метод может использоваться без m