Компьютерные науки > Машинное обучение [представлено 8 октября 2026 года] Название: Единый оператор "Беллмен" по обеспечению безопасности - критический учебный вид PDF HTML (экспериментальный) резюме: Для обеспечения применения обучения в важнейших областях безопасности требуется максимальное выполнение задач при строгом соблюдении ограничений на безопасность. Существующие парадигмы безопасного обучения обычно заставляют идти на компромисс: они либо требуют априори знаний для обеспечения строгих гарантий безопасности (например, фильтров безопасности), либо позволяют совместно учиться, но только в среднем удовлетворяют требованиям безопасности. В этой работе мы предлагаем новый оператор Bellman, который объединяет цели эффективности и безопасности в функцию совместной ценности. Мы показываем, что изучение временны́х различий с совместным оператором Bellman соединяется в двухкратной сточастной системе приближения. На скоростной основе оценивается ценность совместной политики в области обучения с точки зрения безопасности, а на основе медленных сроков - совокупная стоимость. Конвергенция обеспечивается путем формулирования ограничительной динамики в качестве среднего показателя оккупационной дифференциации и демонстрации того, что она асимптотически сходится с набором ограниченных оптимальных функций по определению целевой ценности с учетом требований безопасности. Теоретически, как только они совпадали, конечная оптимальная политика позволяет максимально повысить отдачу от…
Единый оператор по обучению навыкам укрепления безопасности
arXiv: 2610.12420v1 Тип объявления: новое резюме: усиление обучения в важнейших областях безопасности требует максимального выполнения задач при строгом соблюдении ограничений на безопасность. Существующие парадигмы безопасного обучения обычно заставляют идти на компромисс: они либо требуют априори знаний для обеспечения строгих гарантий безопасности (например, фильтров безопасности), либо позволяют совместно учиться, но только в среднем удовлетворяют требованиям безопасности. В этой работе мы предлагаем новый оператор Bellman, который объединяет цели эффективности и безопасности в функцию совместной ценности. Мы показываем, что изучение временны́х различий с совместным оператором Bellman соединяется в двухкратной сточастной системе приближения. На скоростной основе оценивается ценность совместной политики в области обучения с точки зрения безопасности, а на основе медленных сроков - совокупная стоимость. Конвергенция обеспечивается путем формулирования ограничительной динамики в качестве среднего показателя оккупационной дифференциальной интеграции и демонстрации того, что она асимптотически сходится t