Компьютерная наука > Расчет и язык [представлен 17 сентября 2026 года] Название: F$_ {2}$DR: Fine-grained Pipeline Reward Framework for DeepSearch Work Flows View PDF HTML (экспериментальное) резюме: вместе с широким промышленным внедрением больших языковых моделей (LMM), Дипесерх стала доминирующей парадигмой для решения сложных запросов пользователей. Она обычно функционирует через итеративный замкнутый рабочий процесс, состоящий из планирования и анализа, поиска информации и получения ответов. Вместе с тем существующие модели вознаграждения (РМ) и контрольные показатели оценки предназначены главным образом для выполнения статических задач, связанных с одним поворотом, в результате чего не удалось отразить всю сложность рабочих процессов DeepSearch. Для устранения этого ограничения мы предлагаем F2DR, тонкую систему вознаграждения по полной линии DeepSearch. F2DR проводит оценку рабочих процессов DeepSearch по трем аспектам: содержание, траектория и ответ, что позволяет провести всеобъемлющую оценку на уровне процесса. Мы далее строим DeepSearch RM-Bench, специальный эталонный показатель для оценки RM в сценариях DipSearch. Широкие эксперименты показывают, что F2DR обеспечивает значительно более высокую степень согласованности оценок по сравнению с базовыми показателями на основе самооценки, в то время как DeepSearch RM-Bench обладает значительным потенциалом для проведения различий между существующими РМ из открытых источников. Скоро мы опубликуем полный набор данных…
F$ {2}$DR: Фундаментальная полноценная система вознаграждения за работу в области DeepSearch
arXiv:2609.19827v1 Annuales Type: New Humber Brieflow: После широкого промышленного внедрения крупных языковых моделей (LMS) DeepSearch стала доминирующей парадигмой для решения сложных запросов пользователей. Она обычно функционирует через итеративный замкнутый рабочий процесс, состоящий из планирования и анализа, поиска информации и получения ответов. Вместе с тем существующие модели вознаграждения (РМ) и контрольные показатели оценки предназначены главным образом для выполнения статических задач, связанных с одним поворотом, в результате чего не удалось отразить всю сложность рабочих процессов DeepSearch. Для устранения этого ограничения мы предлагаем F2DR, тонкую систему вознаграждения по полной линии DeepSearch. F2DR проводит оценку рабочих процессов DeepSearch по трем аспектам: содержание, траектория и ответ, что позволяет провести всеобъемлющую оценку на уровне процесса. Мы далее строим DeepSearch RM-Bench, специальный эталонный показатель для оценки RM в сценариях DipSearch. Широкие эксперименты показывают, что F2DR обеспечивает значительно более высокую степень согласованности оценок.