Реклама

Изучаются ли МЛМ награды в контексте?

#Изучаются #Annuales #Type #Humber #Abstract

arXiv:2610.11152v1 Annuales Type: New Humber Abstract: LLM-агенты все больше совершенствуются в момент вывода, накапливая опыт в контексте, а не путем обновления параметров. Этот процесс часто описывается как обучение по принципу " внутритекстового усиления &qt; (ИКRL). Вместе с тем не было проведено испытаний на то, может ли обучение in-context (ICL) реально играть роль RL. Мы изучаем этот вопрос в его самом простом виде, прямо ICDL, где типовые условия непосредственно на первичных траекторий-парах, и задаемся вопросом о том, является ли вознаграждение сигналом обучения. С помощью контролируемых экспериментов по четырем контрольным показателям из шести моделей мы видим, что вознаграждение читается, но его эффект невелик: перескакивание, случайность или удаление вознаграждения оставляет кривую улучшения практически неизменной, и это держит даже под мета-скорректированными, которые ясно указывают модели исследовать, эксплуатировать или рассуждать над наградами. Траектории приводят к улучшению, но не в силу их семантического содержания: перевернутые или поврежденные траектория работают так же как и реальные.