Учеба по вопросам политики с использованием языкового узла
arXiv:2405,04118v4 Annualce Type: заменить кросс-бюллетень: Современные системы АИ, такие как самоуправляющиеся автомобили и игровые игроки могут достичь сверхчеловеческих результатов, но часто не имеют такого же человеческого обобщения, интерпретируемости и взаимодействия с человеческими пользователями. Вдохновляемые богатым взаимодействием между языком и принятием решений в людях, мы внедряем программное обучение с узким местом языка (LPLB) — рамочную основу, позволяющую агентам АИ разрабатывать языковые правила, которые отражают стратегии высокого уровня, лежащие в основе вознаграждающего поведения. PLLB чередует этап *появление правил*, основанный на языковых моделях, и этап *обновленный*, когда агенты учатся новой политике, основанной на правилах, даже если правила недостаточны для описания всей сложной политики. В рамках пяти различных задач, включая игру с двумя игроками, лабиринтное плавание, восстановление изображений и планирование хватки роботов, мы показываем, что агенты PLLB не только способны выучить более интерпретируемое и общее поведение, но также могут