Компьютерные науки > Машинное обучение [представлено 24 августа 2026 года] Название: Robound Generaled Q-Learning with почти без общения HTML (экспериментальный) Резюме: Мы рассматриваем федеральную систему дополнительного обучения с участием агентов M$, все из которых взаимодействуют с общим процессом принятия решения Марковым. Агенты обмениваются информацией через центральный сервер для изучения функции оптимального значения. Наша цель состоит в том, чтобы понять, насколько можно надеяться на совместные ускоренные пробоотборные операции в таких условиях, когда небольшая часть агентов является состязательной и может действовать произвольно. С этой целью мы предлагаем Fed-Q}, федеративный алгоритм Q-обучения, который смешивает идеи как на основе моделей, так и без модели RL вместе с устройством медианы средств из надежных статистических данных. Мы доказываем, что, несмотря на коррупцию с высокой вероятностью, Roust Fed-Q i) гарантирует точное совпадение функции оптимальности стоимости в пределах бесконечного количества образцов и ii) имеет почти оптимальный конечный временной показатель, который выгоден от сотрудничества. Кроме того, наш подход требует проведения всего лишь раундов связи в размере $tillde {O}(1) для достижения каждой из вышеуказанных гарантий - характерной особенностью независимого интереса к ФЛ, где связь является основным узким местом. Текущий контекст просмотра: cs.LG ссылки и цитаты загрузка... Библиографические и цитационно-инструментальные средства…
Учеба в рамках программы " Занятие без общения &qt;
arXiv: 2609,201074v1 Annualte Type: new Brieflow: Мы рассматриваем возможность федерального обучения по вопросам усиления с участием агентов M$, все из которых взаимодействуют с общим процессом принятия решений Марковым (MDP). Агенты обмениваются информацией через центральный сервер для изучения функции оптимального значения. Наша цель состоит в том, чтобы понять, насколько можно надеяться на совместные ускоренные пробоотборные операции в таких условиях, когда небольшая часть агентов является состязательной и может действовать произвольно. С этой целью мы предлагаем Fed-Q}, федеративный алгоритм Q-обучения, который смешивает идеи как на основе моделей, так и без модели RL вместе с устройством медианы средств из надежных статистических данных. Мы доказываем, что, несмотря на коррупцию с высокой вероятностью, Roust Fed-Q i) гарантирует точное совпадение функции оптимальности стоимости в пределах бесконечного количества образцов и ii) имеет почти оптимальный конечный временной показатель, который выгоден от сотрудничества. Кроме того, наш подход требует лишь $tilde {O}(1) раундов связи с ак