Реклама

На пути к оптимальному сожалению в недиверсиальных MDP со Стохастическими жесткими ограничениями

#Стохастическими #Аннот-Тип #Марковым #Stradi #Интересно

arXiv:2610.12153v1 Аннот-Тип: новое резюме: Мы изучаем эпизодические проблемы, ограничивающие процессы принятия решений Марковым со состязательными потерями при стохастических жестких ограничениях. Если говорить конкретно, то начиная с известной строго осуществимой политики в отношении разницы в долл. В этой ситуации Stradi et al. (2025) показывают, что тщательно разработанное правило смешивания вызывает сожаление в связи с порядком $_wideralde {\mathcal {O}(#sqrt {T}/\мин\ {d, d>2\} долл. Интересно, что они также предусматривают более низкий предел порядка в размере $\Omega(#sqrt {T}/ rho) долл. В этой работе мы опираемся на их подход, с тем чтобы добиться оптимальной зависимости от этих пределов. Если говорить конкретно, то мы предлагаем М-ОПС - алгоритм, сочетающий оптимистичный поиск слейтера и пессимистическую оценку выбранной политики в целях безопасного изучения политики с большой допустимой вероятностью. Т