Реклама

Понимание кода - это узкий пункт для кодовых агентов

#Понимание #Annualce #Type #SWE-bench #CABRA

arXiv: 2610.10.110v1 Annualce Type: перекрестное резюме: репозитории (например, SWE-bench) для агентов кодирования часто предполагают, что строки отредактированных кодов могут предсказывать трудности задачи, но плохое управление такими наборами данных кода и типов задач затрудняет определение того, какие способности действительно ведут ошибки агента. Мы представляем CABRA: Концепцию Кодирования способности для оценки злостных агентов. CABRA создает задачи с нуля, как изменения календарей и масштабов через параметр размера задач на четырех осях: функция траверсальна, поиск, разрешение времени работы и инструкция следующего содержания. Мы запустили восемь МЛМ и шесть агентов кодирования на 6 840 задач CABRA, чтобы показать: 1) точность LLM падает как размер задачи~гроузы, но агенты остаются почти идеальными благодаря отгрузке работы в инструменты (например, grep); 2) более крупные задачи CabRA вызывают больше вызовов для чтения и анализа, а отдельное исследование SWE-bunch Verificed показывает, что эти номера звонков с помощью инструментов предсказывают точность агентов лучше, чем линии редактирования кода, предположив трудности при выполнении задания агентами