Улучшенная зависимость от Бандит Конвекс Оптимизация с грациентскими изменениями
arXiv: 2602.04761v2 Annuate Type: заменить кросс-бюллетени: Градиент-вариантное обучение в Интернете привлекло все большее внимание благодаря его глубоким связям с теорией и оптимизацией игр. Она широко изучалась в условиях полной информации, но недостаточно изучена с помощью обратной связи между бандитами. В этой работе мы концентрируем внимание на градиентной вариации в оптимизации Bandit Convex (BCO) с двухточечной обратной связью. Предлагая усовершенствованный анализ неконструктивных градиентных вариаций, которые являются фундаментальным количеством изменений градиентов с обратной связью бандитов, мы улучшаем зависимость между измерениями как выпуклых, так и сильно переворачивающихся функций по сравнению с наиболее известными результатами (Chiang et al., 2013). Совершенствование нашего анализа неконкурирующих градиентных колебаний также предполагает другие благоприятные, зависящие от проблем гарантии, такие как пределы градации и небольших потерь. Помимо двух пунктов, мы демонстрируем универсальность нашего метода путем достижения первой градиентной изменчивости в пределах одной точки.