Либра: Эффективное управление ресурсами для агентских РЛ после прохождения подготовки
arXiv: 2606.03077v3 Annuales Type: заменить резюме: усиление обучения (RL) стало стандартной послеучебной парадигмой для формирования крупных языковых моделей (LMS) в качестве способных агентов. В агентском RL на этапе запуска образуются траектории, в то время как используются инструменты, что создает объем работы в течение долгого времени и без остановок, который ставит две фундаментальные задачи. Во-первых, в результате распространения ответов на большие расстояния небольшая часть траекторий доминирует над ломом. Во-вторых, развертывание и тренировка различаются по своим схемам вычисления, требованиям памяти и чувствительности к длине последовательности. По мере развития этой политики изменения в распределении рабочей нагрузки еще больше изменяют их относительные потребности в ресурсах, что затрудняет обеспечение сбалансированного исполнения на всех двух этапах. Мы представляем Libra, адаптивное время работы для агентского RL после тренировки с двумя дополнительными компонентами: 1) внутриэтапное планирование через кабельно-руководимый бакетный график, который путешествует по ведре исполнения с разными p