Минимум ПХД границы для обучения в внешних контекстуальных МВУ
arXiv:2606.25170v2 Вид уведомления: заменить резюме: мы введем систему ПАК, при которой ученик может получить доступ к пробоотборным оракулам как до принятия решения, так и во время его принятия. Сложность выборки измеряется по паре долларов (n,m) долл. США, где $n - это бюджет обучения, затраченный до того, как будет известен запрос, и $m$ является дополнительным бюджетом выборки на один запрос. Мы демонстрируем ее значимость в дисквалифицированных процессах принятия решений Марковым с внешними контекстами i.i.d., которые были выявлены до начала действия. Контексты могут влиять как на вознаграждение, так и на переход, однако агент по-прежнему не контролирует их. Ученик может взять выборку неизвестного распределения контекста и переходного ядра. Мы изучаем вопросы оценки политики (ОПЭ), оценки наилучших затрат (ОЭД) и разработки наилучшей политики. Когда награды и изменения известны, алгоритм с пониженной вариацией решает все три задачи с выборочной сложностью $\bigl(#широкотилде О ((1-/ gamma) {-3}\varepsilon {-2}), 0\bigr) долл., что является минимаксимальным до логарифматических факторов. Пусть $mathcal будет контролируемым государственным пространством. W