Модель обучения на длительно-горизонтном языке

#Модель #Annuate #Type #Humber #Abstract

arXiv: 2609.07303v1 Annuate Type: New Humber Abstract: Текущие парадигмы для учебных языковых моделей с помощью дополнительного обучения в значительной степени зависят от небольшого количества наград. Однако по мере того, как мы выполняем задачи, требующие более продолжительных и сложных траекторий, такие стратегии приводят к замедлению процесса обучения. В ходе предыдущей работы предпринимались попытки решить эту проблему путем поощрения частичного прогресса; однако наивные формулировки зачастую носят предвзятый характер и совпадают с неоптимальными стратегиями. Мы показываем, что простая и непредвзятая густая формула вознаграждения, которую мы называем прогрессивным сопоставлением точек, в экспоненциальной степени более эффективна для долгосрочных задач путем поощрения частичного прогресса на сегментном уровне как теоретически, так и эмпирически через синтетические среды. Затем мы показываем, как прогрессивное сопоставление точек может быть практически мгновенным с использованием единой контрольной траектории каждой задачи. При очень сложных проблемах с математикой малоэффективные награды не могут добиться никакого прогресса, в то время как сегментные вознаграждения позволяют улучшить положение на более крупных te