Оптимизация политики двух осей для агентов LLM: Байесовская реакция и нормализация траектории массы
arXiv:2609.19830v1 Annuate Type: New Humber Abstractive: Укрепление обучения для агентов LLM включает два различных ди-мензона оптимизации: как используется обратная связь с окружающей средой в рамках траектории и каким образом полные траегории агрегируются по всей партии. Мы формулируем эти димен-сионы как внутрипутевую атрибуцию и межтраекторную Агрегацию, и внедряем НИМОН (байезийскую аттрибию и транспоральную цель), систему оптимизации политики с двойной осью. НИМОН подмечивает первую ось с байезийской обратной связью, которая создает обратную связь, обусловленную запоздалым действием, и вторую - с Трахек-ториной нормализацией массы (TMN), в которой равная оптимизация массы для com-plite траектории. Эксперименты с ГМПО и ГГИПО на ALFWorld, WebShoop и SearchQA показывают, что обе оси обеспечивают независимые выгоды и что их комби-нация последовательно достигает самых высоких общих показателей в масштабах моделей.