Реклама

Подопечный регион Q

#Подопечный #Недавно #Q-обучения #Common #Matching

arXiv: 2605.27079v2 Тип объявления: заменить перекрестное резюме: изучение не связанных с политикой аспектов политики, касающихся стратегий регулирования потоков, по-прежнему сопряжено со значительными трудностями изза нестабильности оптимизации в результате многоэтапного процесса отбора проб. Недавно в рамках программы Q-обучения с организацией "Ad Common Matching" (QAM) это было сделано путем изменения подхода к улучшению политики как проблемы, связанной со стохастическим оптимальным контролем (SOC), под руководством одного из ученых. Вместе с тем КАМ унаследовал фундаментальную хрупкость критико-ориентированного улучшения, поскольку небольшие критические ошибки могут быть экспоненциально усилены и зачастую приводить к коллапсу в работе. Настоящий документ представляет собой устойчивый алгоритм откорректировки, позволяющий адаптационно контролировать тротуарный KL между усовершенствованной и заранее подготовленной политикой на основе предполагаемого двойного происхождения. В частности, мы адаптируем параметр доверия региона $lambda$ в рамках процесса отбора проб политики потока и докажем, что $lambda$ точно весит пространство пути KL в цели SOC. В результате, наша я