$OneMillion-Bench: Как далеко находятся языковые агенства от экспертов?
arXiv: 2603.07980v2 Annuales Type: заменить перекрестное резюме: Поскольку языковые модели (MDs) изменяют друг друга, ассистенты по чатам становятся долгосрочными агентами, способными многоэтапно рассуждать и использовать инструменты, существующие контрольные показатели в основном ограничиваются структурированными или экзаменированными задачами, которые не отвечают реальным требованиям специалистов. С этой целью мы введем $OneMillion-Bench (\$OMB) — эталонный показатель, включающий 400 сканируемых экспертами задач, охватывающих законодательство, финансы, промышленность, здравоохранение и естественные науки, которые были построены для оценки агентов во всех экономически значимых сценариях. В отличие от предыдущей работы, для определения контрольного показателя требуется поиск авторитетных источников, устранение противоречивых доказательств, применение правил в отношении конкретных доменов и принятие ограничительных решений, когда правильность зависит не только от процесса обоснования, но и от окончательного ответа. Мы принимаем протокол оценки, основанный на отдельных рубриках и предусматривающий фактологическую точность, логическую согласованность, практическую осуществимость и профессиональное соблюдение с уделением особого внимания проблемам уровня экспертов в целях обеспечения существенной дифференциации.