Компьютерные науки > Искусственный интеллект [представлен 7 сентября 2026 года] Название: Что на самом деле можно сравнить с рейтингом LLM-агента? Вид PDF HTML (экспериментальное) Резюме: лидер LLM предлагает знакомый вывод: агент, ранжированный выше другого, является лучшим агентом. Общественные регистрационные журналы оценки могут не служить основанием для такого вывода, когда системы различаются в зависимости от смеси задач, источника маркировки, детализации выпуска или правила затрат. Мы изучаем, какие оценки дают лидеры и когда они оправдывают выводы о превосходстве по паре. Наша процедура оценки по двум направлениям предусматривает сопоставление цели и источника измерения, проверяет общую поддержку и оценивает поддерживаемую разницу с использованием указанного правила неопределенности и практической разницы. Контролируемые проверки позволяют оценить знаки принятия решений при известных конечных условиях отбора и продемонстрировать, почему при определении степени чувствительности к перевзвешению целевых показателей следует учитывать факторы неопределенности. В рамках SWE-bench, агент Ревордбенч и тау2-бэнч часто не удается решить проблемы, связанные с тесными различиями в рейтингах; опосредованная маркировка и правила использования могут также изменить выбранную систему. Дейта-агент Бэнч и Open Agents показывают то, что можно оценить из открытых записей Карсера. Оценочный балл лидера резюмирует выпущенную оценку, в то время как превосходство мелкозернистых также зависит…
Что на самом деле можно сравнить с рейтингом LLM-агента?
arXiv: 2609,07785v1 Annualce Type: новый резюме: An LLM-агент-лидер предлагает знакомый вывод: агент в ранге выше другого является лучшим агентом. Общественные регистрационные журналы оценки могут не служить основанием для такого вывода, когда системы различаются в зависимости от смеси задач, источника маркировки, детализации выпуска или правила затрат. Мы изучаем, какие оценки дают лидеры и когда они оправдывают выводы о превосходстве по паре. Наша процедура оценки по двум направлениям предусматривает сопоставление цели и источника измерения, проверяет общую поддержку и оценивает поддерживаемую разницу с использованием указанного правила неопределенности и практической разницы. Контролируемые проверки позволяют оценить знаки принятия решений при известных конечных условиях отбора и продемонстрировать, почему при определении степени чувствительности к перевзвешению целевых показателей следует учитывать факторы неопределенности. В рамках SWE-bench, агент Ревордбенч и тау2-бэнч часто не удается решить проблемы, связанные с тесными различиями в рейтингах; опосредованная маркировка и правила использования могут также изменить выбранную систему. Дейта-Агент Бэнч и открытый агент показывают, что остается ценной лягушонок