Повышение степени обобщения и надежности в процессе обучения по вопросам офлайна с помощью усовершенствования пограничной системы данных

#Повышение #Annualce #Type #Текущие #Существующие

arXiv:2609.20300v1 Annualce Type: новый резюме: Текущие алгоритмы офлайн-укрепления обучения (ОРЛ), как правило, перевыполняют набор учебных данных и демонстрируют недостаточную обобщенную и надежную эффективность в процессе их распространения в реальных средах, что подрывает их эффективность. Существующие методы, как правило, повышают степень обобщения и надежности внутрираспределительной системы за счет использования методов упорядочения, широко используемых в компьютерном видении. Однако из-за высокой чувствительности низкоуровневых физических сигналов к изменениям в распределении эти методы попрежнему страдают от заметных ограничений, связанных с нераспределением общих данных и надежностью, что затрудняет достижение стабильных показателей в сложных условиях. Для решения этой проблемы мы теоретически анализируем границы ошибок в политике поведения и функции действия-ценности, обученной случайным интерполяцией эпизодов, что показывает, что шкала погрешностей положительно соотносится с расстоянием между штатами. Основываясь на этом понимании, мы предлагаем мето