Реклама

Устранение разрыва между горизонтами в области оптимизации политики в отношении межсекторальных МВУ

#Устранение #Аннонс #Марковым #Оптимизация #Q-долларов

arXiv: 2610.12362v1 Аннонс Тип: перекрестное резюме: мы рассматриваем оптимизацию политики для процессов принятия решений Марковым в онлайновой эпизодической табличной форме (МДП) с конкурентными потерями и обратной связью между бандитами. Оптимизация политики обновляет политику на местном уровне в каждом штате и избегает оптимизации по отношению к политопе с измерением загруженности, однако существующие пределы его сожаления являются более значительными в факторе горизонта долл. Мы закрываем этот пробел, используя регулярные функции в размере $Q-долларов, которые позволяют нам контролировать стабильность местных обновлений совместно по всем парам действий государства, а не отдельно в каждом штате. В результате алгоритм достигает высоких вероятностных пределов в размере $(sqrt {HS(H+A)T}), для известных изменений и $2 Urdatilde O (HS\skrt[AT}]$, для неизвестных переходных периодов, где доллар США - это число штатов, количество действий в долларах США и количество эпизодов. Обе границы повышают горизонтальную зависимость существующих границ оптимизации политики, и последние соответствуют t