Оптимизация политики в области " запуска-выращивания > на основе информационных выгод: адаптивный подход к использованию многопутных поисковых агентов
arXiv: 2607.06223v2 Annuales Type: заменить резюме: " Укрепление обучения (RL) улучшает работу агентов большой языковой модели (LLM) в рамках долгосрочных поисковых задач, которые требуют принятия нескольких промежуточных решений до окончательного результата. Вместе с тем бюджеты, выделяемые на внедрение системы, часто распределяются без оценки функционирования систем в промежуточном государстве, что позволяет производить расчеты отходов на необычайных отраслях. Мы предлагаем оптимизацию политики в области " запуска с помощью информационной прибыли &qt; (IGRPO), которая представляет собой основу для организации сбора данных о положении дел на уровне полугосударства. В частности, ИГРПО осуществляет составление бюджета на основе концепции " дерево-среда &qt; , в рамках которой вероятность расширения зависит от информативности узлового уровня, что позволяет информационным отраслям получать больше вычислений, тогда как менее содержательные отрасли реже расширяются в рамках фиксированного бюджета. Благодаря непосредственному определению того, как формируются траектории обучения, ИГРПО стимулирует ограниченное распределение преподавателей по отношению к траерориям поиска, что благоприятствует более высокой совокупной информативности. Ресу