Компьютерные науки > Искусственный интеллект [представлен 8 октября 2026 года] Название: Балансирование справочной инструкции и свободное поколение в траектории раскручивания для обоснования RL View PDF HTML (экспериментального) резюме. В качестве альтернативы, префикс эталонной системы может направлять модель в создании собственной траектории. Сколько нам следует дать справочных указаний? Мы изучаем этот вопрос с помощью продолжения префикса, где модель продолжается из исходного преференция и сохраняет полученную траекторию в случае прохождения проверки, возвращаясь к ссылке. Поскольку обе процедуры дают правильные траектории, мы сравниваем их распределение с идеальным распределением, собственное распространение модели зависит от успешной проверки. Для одного продолжения мы вычисляем расхождение KL в закрытой форме, которое до ограниченного термина уменьшается с результатом вероятности создания другой правильной траектории и исходной сюрпризы, отрицательной вероятностью логарифмического суффикса при префиксе. Поскольку более длинный префикс, как правило, повышает уровень первого, но снижает его, один лишь успех в продолжении не определяет предпочтительное количество руководящих указаний. На основе этого анализа мы учимся, что выбор префикса для всех учебных вопросов происходит из результатов продолжения, без оценки вероятности успеха или дополнительного поколения. В результате этого адаптивное справочно-справочное руководство (ARG) устанавливает правильные траектории в…
Сбалансированное справочное руководство и свободное построение в траекториях для обоснования RL
arXiv:2610.111282v1 Annuales Type: New Habstrate: Проверенное справочное решение обеспечивает правильную траекторию для обучения аргументационной модели. В качестве альтернативы, префикс эталонной системы может направлять модель в создании собственной траектории. Сколько нам следует дать справочных указаний? Мы изучаем этот вопрос с помощью продолжения префикса, где модель продолжается из исходного преференция и сохраняет полученную траекторию в случае прохождения проверки, возвращаясь к ссылке. Поскольку обе процедуры дают правильные траектории, мы сравниваем их распределение с идеальным распределением, собственное распространение модели зависит от успешной проверки. Для одного продолжения мы вычисляем расхождение KL в закрытой форме, которое до ограниченного термина уменьшается с результатом вероятности создания другой правильной траектории и исходной сюрпризы, отрицательной вероятностью логарифмического суффикса при префиксе. Поскольку более длинный префикс имеет тенденцию повышать