Реклама

СВЯЗЬ С БЕЗОПАСНОСТЬЮ: Учитываемое контекстом вмешательство человека посредством проведения экстези-запрос-распространения

#СВЯЗЬ #БЕЗОПАСНОСТЬЮ #Учитываемое #Annuales #Type

arXiv: 2607.13594v2 Annuales Type: заменить резюме: агенты LLM действуют в реальных условиях с помощью инструментов, и одно неверное действие может причинить необратимый вред. Стандартная гарантия представляет собой модель защиты, которая обозначает каждое предлагаемое действие как безопасное или небезопасное, однако этот двоичный вид сводится к двум разным решениям: вредно ли это деяние само по себе и уместно ли оно с учетом контекста пользователя. Он также действует в рамках категорий действий, а не отдельных случаев, что приводит к регулярным перерывам, которые подрывают автономию и обучают пользователей волнеть с помощью наиболее сопутствующих предупреждений. Мы переформулируем эту проблему как решение о маршруте в три стороны на каждый случай по отношению к {EXECUTE, ASK, REFUSE} и установим ее с помощью Safety Sentry — легкой модели охраны, вывод которой уменьшается до одного звонка о декодировании. Единый порог декодирования времени позволяет перераспределять один стационарный контрольно-пропускной пункт между различными точками допуска к риску без переподготовки. Безопасность

Компьютерная наука > Искусственный интеллект [представлен 15 июля 2026 (v1), последний раз пересмотрен 8 октября 2026 года (эта версия, v2)) Название: SAFETY SENTRI: Context-Wree Human Introduction через ExECUTE-ASK-REFUSE Routing View PDF HTML (экспериментальное) резюме: агенты LLM действуют в реальных условиях с помощью инструментов, и одно неверное решение может причинить необратимый ущерб. Стандартная гарантия представляет собой модель защиты, которая обозначает каждое предлагаемое действие как безопасное или небезопасное, однако этот двоичный вид сводится к двум разным решениям: вредно ли это деяние само по себе и уместно ли оно с учетом контекста пользователя. Он также действует в рамках категорий действий, а не отдельных случаев, что приводит к регулярным перерывам, которые подрывают автономию и обучают пользователей волнеть с помощью наиболее сопутствующих предупреждений. Мы переформулируем эту проблему как решение о маршруте в три стороны на каждый случай по отношению к {EXECUTE, ASK, REFUSE} и установим ее с помощью Safety Sentry — легкой модели охраны, вывод которой уменьшается до одного звонка о декодировании. Единый порог декодирования времени позволяет перераспределять один стационарный контрольно-пропускной пункт между различными точками допуска к риску без переподготовки. SafetySentry превзойдет широкий набор открытых и пограничных исходных линий с закрытого исходного значения общей точности и отзыва данных о безопасности, контролируя оба показателя…