Варианты иерархического обучения
arXiv:2610.121335v1 Annualte Type: New Humber Abstractive: Учеба в решении долгосрочных задач, связанных с достижением целей, требует от агента рассуждать о длительном времени и действовать по широкому кругу государств. В принципе, обучение по вопросам иерархии (УЛР) решает как проблемы на основе взаимодействия действий (временных), так и абстракций состояния (пространственных). Во-первых, использование абстракции действия для представления поведения в течение определенного периода времени как варианта уменьшает возможности эффективного принятия решений. Во-вторых, создание возможностей для различных абстракций государств на каждом уровне процесса принятия решений позволяет проводить большее агрегирование данных в целях обучения. Вместе с тем реализация этих двух преимуществ иерархической политики зависит от того, будет ли проводиться абстракция соответствующих действий. Текущие алгоритмы HRL не работают в двух отношениях. Некоторые отказываются от различий между вариантами, необходимыми для оптимального контроля, что полностью подрывает иерархию. Другие сохраняют ненужные различия, сохраняя горизонтальный спад, но теряя состояние абстракции