Удивительная эффективность итерации непосредственной ценности в самопромысле

#Удивительная #Annuate #Type #Humber #Abstract

arXiv: 2609.09094v1 Annuate Type: New Humber Abstract: Commining поиска с аппроксимацией функций является движущей силой крупных достижений в игровых программах, делая алгоритмы самоиграния более конкурентоспособными, чем когда-либо ранее. Тем не менее расчетные накладки наиболее популярных методов, основанных на поиске деревьев в Монте-Карло (MTCS), могут быть значительными. В этой работе мы изучаем вопрос о том, остаются ли более простые методы конкурентоспособными в нетривиальных и умеренных играх, таких как Connect Four, Hex(7x7) и синтетические игры. Мы тренируем минимально самопроигрышную реализацию приблизительной итерации (АВИ) и используем оракулы наземной правды для точной оценки. Вопреки ожиданиям, наши результаты свидетельствуют о неожиданной эффективности АВИ: она учится более точно выполнять функции ценности по сравнению с теми, которые были усвоены компанией " АльфаЗеро &qt; , в то время как ее одноэтапная алчная политика остается конкурентоспособной с политикой на основе МТКК при значительно меньших затратах на подготовку кадров и выводы. Предварительные эксперименты на Othello and Go(9x9), показывают, что поезда AVI стойки на

Компьютерная наука > Искусственный интеллект [представлен 8 сентября 2026 года] Название: "Сюрприз-эффективность приблизительной итерации значения в Self-Play View PDF HTML (экспериментальный) резюме: комбинирование поиска с аппроксимацией функций привело к крупным достижениям в игровых программах, сделав алгоритмы самопроигрывания более конкурентными, чем когда бы то ни было. Тем не менее расчетные накладки наиболее популярных методов, основанных на поиске деревьев в Монте-Карло (MTCS), могут быть значительными. В этой работе мы изучаем вопрос о том, остаются ли более простые методы конкурентоспособными в нетривиальных и умеренных играх, таких как Connect Four, Hex(7x7) и синтетические игры. Мы тренируем минимально самопроигрышную реализацию приблизительной итерации (АВИ) и используем оракулы наземной правды для точной оценки. Вопреки ожиданиям, наши результаты свидетельствуют о неожиданной эффективности АВИ: она учится более точно выполнять функции ценности по сравнению с теми, которые были усвоены компанией " АльфаЗеро &qt; , в то время как ее одноэтапная алчная политика остается конкурентоспособной с политикой на основе МТКК при значительно меньших затратах на подготовку кадров и выводы. Предварительные эксперименты на Othello and Go(9x9), показывают, что AVI обучается в больших играх и получает эффективные функции. Эти выводы свидетельствуют о том, что успех методов на основе МТТС мог затмевать более простые подходы, которые становятся все более практичными с…