Тот же результат, различные доказательства: предполагаемое восстановление в оценке безопасности на МУЗ
arXiv: 2610.11766v1 Annualce Type: новый резюме: оценки безопасности моделей с большим языком, как правило, резюмируют вредоносное поведение с коэффициентом успеха при нападении (ASR). Однако одни и те же невредимые последствия могут возникать по очень разным причинам. Модель может восстановить вредную задачу и отказаться от нее, не вернуть ее или полностью отреагировать на что-то другое. Проведение различий между этими случаями приобретает особенно важное значение в связи с надуманными попытками, когда низкий уровень РСО не позволяет установить, была ли фактически выполнена оцениваемая задача. Для того чтобы это различие было ясным, мы сочетаем АСР с коэффициентом оперативного понимания (УР), который позволяет определить, определяет ли ответ как оцениваемая задача, так и рассматривает ее в качестве задачи, на которую необходимо дать ответы. В рамках интерфейсов этот парный взгляд показывает значительные колебания, скрытые АСР: аналогичные значения АСР могут соответствовать резко различающимся коэффициентам восстановления. Контролируемые реконструкции на английском языке свидетельствуют о том, что восстановление неуклонно улучшается по мере того, как сжатые сигналы становятся все более ясными, в то время как