Компьютерные науки > Машинное обучение [представлено 14 сентября 2026 года] Название: Bandits with Probing: Optimal response and the Cimities of Winner View PDF HTML (экспериментальное) резюме: Ученики получают максимум $ кепрь в долл. США каждый раунд, получают максимальную награду за [0,1] долларов и конкурируют с лучшим фиксированным рукавом. Когда это преимущество помогает учиться? Мы определим два закона мини-максимум. В рамках независимых стохастических наград с обратной связью победителя (максимальная и победная лейбл), или в случае произвольных фиксированных последовательностей, при наличии одного подписанного контраста между блок-максимумами, миниМакс сожалений имеет заказ $\Phi_ {n,k}(T)=\мин\frac {n-K} {k} долл. США, 2~le k>n долларов. При обратной связи победителей, как произвольное соединение i.i.d, так и фиксированные последовательности имеют минимально допустимое сожаление в отношении заказа $R_n,k(T)=\frac {n-k} {n#N\t, frac {n+T} {k}, sqrt {unT}}}$$. Оба закона имеют универсальные константы и любые верхние границы. Первая из них позволяет уменьшить сожаление в связи с чистыми расходами на страхование: одни и те же контрасты поглощают расходы, связанные со стабильностью, а независимость дает возможность точно переосмыслить выборку, чей доход будет финансироваться за счет средств, выделяемых для финансирования выборочных проектов. Во-вторых, стоимость обучения становится сопоставимой с стоимостью охвата в пределах горизонта в долл. США; помимо $nk, числовая…
Банты с поиском: оптимальное сожаление и пределы обратной связи победителей
arXiv:2609.15248v1 Annualce Type: cross Brief: Studyer standings не более чем в долл. США каждый раунд, получает максимальную награду в размере [0,1] долларов и соревнуется с лучшими фиксированными руками. Когда это преимущество помогает учиться? Мы определим два закона мини-максимум. В рамках независимых стохастических наград с обратной связью победителя (максимальная и победная лейбл), или в случае произвольных фиксированных последовательностей, при наличии одного подписанного контраста между блок-максимумами, миниМакс сожалений имеет заказ $\Phi_ {n,k}(T)=\мин\frac {n-K} {k} долл. США, 2~le k>n долларов. При обратной связи победителей, как произвольное соединение i.i.d, так и фиксированные последовательности имеют минимально допустимое сожаление в отношении заказа $R_n,k(T)=\frac {n-k} {n#N\t, frac {n+T} {k}, sqrt {unT}}}$$. Оба закона имеют универсальные константы и любые верхние границы. Первая из них позволяет уменьшить сожаление в связи с чистыми расходами на страхование: одни и те же контрасты поглощают расходы, связанные со стабильностью, а независимость дает возможность точно переосмыслить выборку, чей доход будет финансироваться за счет средств, выделяемых для финансирования выборочных проектов. Второй добавляет стоимость обучения, котораяb