Безопасные действия в одиночку не обеспечивают безопасность агентов: выявление невыполненных обязательств с моделями охраны
arXiv: 2610.11773v1 Annuales Type: новый резюме: модели охраны все чаще используются для защиты агентов на базе LLM, главным образом путем выявления действий, которые агентам запрещено совершать. Однако одного лишь определения запрещенных действий недостаточно для обеспечения безопасности агентов. В этом документе мы заявляем, что безопасность агентов также зависит от выявления требуемых и нереализованных мер по обеспечению безопасности, которые мы называем обязательствами. Наше предварительное исследование по популярному контрольному показателю для оценки безопасности показывает, что 56,92% траекторий ГЛМ-5.3 содержат невыполненные обязательства, в то время как только 30,00% содержат запрещенные действия. Этот вывод свидетельствует о том, что невыполненные обязательства являются одним из основных и ранее игнорируемых источников риска для безопасности. Однако, насколько нам известно, ни один существующий эталонный показатель не позволяет оценить, могут ли модели охраны определять эти обязательства. Для устранения этого пробела мы введем механизм " Обязательство-Бенч &qt; , который является первым контрольным показателем для оценки возможностей выявления обязательств и включает 240 подтвержденных экспертами траекторий