Должен ли ты доверять результатам в показателях кодирования? Аудиторская проверка контрольных параметров на основе эволюции оценки
arXiv: 2610.10.10619v1 Annuales Type: кросс-бюллетень: агенты большой языковой модели (LLM) быстро перестраивают проектирование программного обеспечения, сопровождаемое взрывом новых кодовых контрольных параметров. Тем не менее почти все существующие контрольные показатели по-прежнему основываются на одном и том же десятилетнем критерии: решение является правильным, если оно проходит фиксированный набор испытаний. Такие тесты часто недостаточны: они проверяют лишь часть того, что требуется для задания, поэтому агенты могут награждать их или молча пропускать требуемое поведение при прохождении каждого испытания. В результате более высокие контрольные показатели могут отчасти отражать более эффективную адаптацию к оценке, а не лучшее решение проблем. Существующие работы сосредоточены на увеличении статических тестов: они укрепляют испытания каждой задачи один раз, до того как будет замечено какое-либо испытание и таким образом не учитывают то, насколько реальные испытания действительно провалились. Мы введем TestJack, масштабируемую систему оценки пятен сверх фиксированных испытаний. Для каждого испытания TestJack проводит тесты, направленные на удовлетворение оперативных требований, которые могут нарушаться пятнами.