Укрепление обучения улучшает траверсацию параметрических знаний в МЛ

#Укрепление #Annuales #Type #Вместо #Этому

arXiv: 2511.05933v3 Annuales Type: заменить резюме: подкрепление обучения (RL) часто считается улучшением рассуждений за счет фактических знаний. Вместо этого мы находим, что модели рассуждений являются более эффективными, чем их корректируемые версии с фактическим отзывом данных путем более эффективного доступа к существующим параметрической информации. В пяти модельных семьях, структурированное стимулирование, которое прямо направляет модели через иерархический траверсальный путь, восполняет бóльшую часть этого пробела, что говорит о том, что значительная часть недостающих знаний скорее скрыта, чем отсутствует. Этому также способствуют контролируемые эксперименты в области RL: подготовка по неизвестным, неотчуждаемым фактам позволяет лучше воспоминать задерживаемые, частые, но ранее недоступные факты и исключает возможность простого разглашения данных. Разукрупнение цели подготовки еще больше объясняет эту выгоду итерированной на политическом уровне разведкой. Тот же механизм представляется поведенческим и внутренним: преимущество аргументации растет с глубиной поиска, в то время как анализ слоя находит похожие фактические представления