Реклама

Быстрее скоординировать: политика в отношении многоагентных потоков в режиме " один шаг-в онлайн &qt;

#Быстрее #Annualce #Type #Humber #MARL

arXiv: 2610,01882v 1 Annualce Type: New Humber: MARL (новое резюме): многоагентное обучение в целях укрепления (MARL) обеспечивает мощную основу для изучения скоординированного поведения посредством взаимодействия с окружающей средой. Разработка политики в области МАРЛ требует сбалансированного сочетания экспрессивной модели распределения комплексных и мультимодальных мер с эффективной подготовкой кадров и осуществлением. Политика в области генерации, особенно политика на основе распространения, может верно отражать сложные и мультимодальные модели поведения, однако дорогостоящие итеративные методы отбора проб препятствуют их масштабированию в онлайновых многоагентных параметрах. Мы предлагаем онлайновую систему MARL с помощью одноэтапной модели потока (OMAF), которая сочетает экспрессивную стимулирующую политику и эффективное формирование одноступенчатых действий. ОМАФ использует политику регулирования потоков на основе трансформатора для отражения сложных координационных моделей, в то время как ее примерная суррогатная траектория обеспечивает принципиальный путь синхронизации политики оптимизации потока. Для того чтобы обучение было стабильным и эффективным с точки зрения выборки, мы будем продолжать разрабатывать совместный план оптимизации