Высший орган по надзору за действиями делает политику сильной
arXiv:2610.117175v1 Вид уведомления: перекрестное резюме: Современные методы принятия решений, основанные на данных, такие как имитация обучения (IL) и усиление обучения (RL), добились больших успехов в решении многих сложных задач. Однако эти методы часто сталкиваются с серьезными проблемами нестабильности и надежности контроля, когда они применяются в реальных условиях, таких как робототехника и автономный вождение, что создает значительные проблемы для их практического применения. Мы утверждаем, что эта проблема нестабильности обусловлена главным образом их ограничениями в плане исключительно контроля и оптимизации действий нулевого порядка (т.е. В этом документе мы показываем, что одновременное наблюдение за действиями как нулевого, так и первого порядка может резко повысить эффективность политики и ее контрольную надежность. Для достижения этой цели мы внедряем новую и элегантную схему потерь, подкрепленную официальными теоретическими гарантиями, которые могут оснащать любую неосновную политическую модель (см.