Компьютерные науки > Искусственный интеллект [представлен 16 сентября 2026 года] Заголовок: " Назад пообещание: спотыкание данных способствует обеспечению безопасности в больших языковых моделях Вид HTML (экспериментальный) резюме: гармонизация безопасности учит большие языковые модели распознавать вредные запросы и отклонять рискованные инструкции. Вместе с тем согласованные модели могут оказаться безуспешными, когда вредные намерения скрываются в кажущихся доброжелательными контекстах. Таким образом, для обеспечения надежной безопасности требуется знание как границ безопасности, так и textbf {viguence}: способность выявлять необычные помещения, вводящие в заблуждение рассуждения и скрытые риски под поверхностью земли. Бдительность требует, чтобы модели тщательно анализировали лежащее в основе запроса намерение и допущения до того, как действовать. Чтобы развить этот потенциал, мы введем текст bf {cunning Questions}, которые не обязательно связаны с безопасностью, но содержат вводящие в заблуждение предпосылки, атипичные рассуждения или тонкие несоответствия. Мы предполагаем, что обучение не только таким логичным ловушкам может переместиться в критические сценарии безопасности. Эксперименты показывают, что обучение куннингу повышает надежность к внераспределенным нападениям на заключенных и усиливает последующую отработку мер безопасности. Кроме того, расширение существующего технологического трубопровода безопасности с Каннингом устанавливает новое состояние искусства…
Помимо обычного соблюдения: понижающие данные способствуют повышению безопасности в крупных языковых моделях
arXiv: 2609.18515v1 Аннонс Тип: перекрестное резюме: Университет безопасности учит крупные языковые модели (LMS) распознавать вредные запросы и отклонять рискованные инструкции. Вместе с тем согласованные модели могут оказаться безуспешными, когда вредные намерения скрываются в кажущихся доброжелательными контекстах. Таким образом, для обеспечения надежной безопасности требуется знание как границ безопасности, так и textbf {viguence}: способность выявлять необычные помещения, вводящие в заблуждение рассуждения и скрытые риски под поверхностью земли. Бдительность требует, чтобы модели тщательно анализировали лежащее в основе запроса намерение и допущения до того, как действовать. Чтобы развить этот потенциал, мы введем текст bf {cunning Questions}, которые не обязательно связаны с безопасностью, но содержат вводящие в заблуждение предпосылки, атипичные рассуждения или тонкие несоответствия. Мы предполагаем, что обучение не только таким логичным ловушкам может переместиться в критические сценарии безопасности. Эксперименты показывают, что обучение куннингу повышает устойчивость к внераспределенным нападениям на заключенных и укрепляет последующую безопасность