Исследование надежности агентских программ АИ

#Исследование #Annualce #Type #Agentic-AI #Вопрос

arXiv:2609.18298v1 Annualce Type: перекрестное резюме: разработка программного обеспечения на основе Agentic-AI открывает перспективы для ускорения завершения разработки программного обеспечения, повышения эффективности программиста и более надежного кода. Вопрос в том, как мы можем объективно проверить эти утверждения? В рамках этого проекта мы попытались ответить на этот вопрос, основываясь на трех видах практики. Во-первых, мы применили типичный агентский рабочий поток АИ для разработки программного обеспечения. Во-вторых, наши целевые программы были десять хорошо известных программ по обеспечению качества выпуска, написанных человеком Linux, с тем чтобы мы могли сравнить разработанный АИ код с конкретной правдой. В-третьих, мы основывали нашу оценку надежности на широко используемом методе тестирования, фузовых случайных тестов. Для этого теста мы использовали как классическую чёрную коробку, испытания поколения и более современное испытание с использованием AFL++. Мы обнаружили, что генерируемые АИ версии коммунальных программ были как правило такими же надежными - зачастую более надёжными, чем последние гум