Оценка точных результатов и прогнозирование на уровне контрольно-пропускных пунктов в реальных программах
arXiv: 2610.11889v1 Аннонс Тип: перекрестное резюме: Мы представляем контрольный показатель для прогнозирования конечного результата и состояния контрольно-пропускных пунктов только из источника и ввода. Он расширяет прогноз выходных данных в стиле CRUXEval, используя для этого пару коротких и более длинных трасс и контрольно-пропускных пунктов внутри и после петли. Этот контрольный показатель включает 400 случаев из 371 программы Python и C++, оцениваемых в семи режимах по четырем модельным семьям без инструментов или кода. Из 11 200 запланированных прогнозов 11 151 человек дали градуируемые ответы. В случае получения ответов на 33,1-55,2 процентных пункта показатели правильных параметров опережают результаты работы их коллег. Самые сильные показатели набрали 93,0% от конечного результата по более короткой траектории, 77,0 % - финального продукта по длительному тару и 65,5 и 63,5% - двух государственных задач; эти оценки также сохраняются в тех случаях, когда отсутствует ответ как неправильный. Из 2 397 сопоставления Python с идентичным источником, меняясь на более длинные входные данные, 528 корректно-транжировочных изменений и 147 обратных изменений. В разбивке по источникам