Мы уже отмечали, что хотя как никогда легче попасть в определенный бар качества благодаря использованию агентами кодирования эффективных методов тестирования, качество программного обеспечения, похоже, ухудшается, и это указывает на то, что те разработчики по умолчанию, которые используют, могут не очень хорошо работать. Здесь мы проверяем, не улучшают ли простые инструкции агентам использовать определенные методы или библиотеки в качестве своего рода теста на то, насколько эффективными являются агенты, когда они руководят кем-то, кто не имеет опыта проверки, который может услышать что вы должны применять некоторые технологии или пользоваться определенными библиотеками. Мы воспользуемся эвалентом внедрения Zstd, обсуждавшимся в этом сопоставлении агентско-лингвальной эффективности программирования и вместо этого сравним различные методы тестирования и библиотеки, когда агентам предоставляется возможность быстро реализовать Зстд с различными добавлениями, такими как "использование экспериментальной разработки", "Употребление Lean 4", "Использование QuickCheck", "Использование тестов на основе собственности" и т.п. Я также провел несколько других эвалентов, таких как IMAP RFC, которые кратко обсуждаются. Все реализовывались в Расте. В числе 26 тестов были: ACL2, Alloy, "Audit and fuzz Riskes", "Audit First", Creusot, Stander (без дополнительных инструкций), Difficioal test, FuzZing, Hegel, Insta, Judgments (агенты просили использовать наилучший метод), Kani, Lean 4, "No dure…
Насколько хорошо агенты используют методы испытаний/проверки?
Статья URL: https://danluu.com/agentic-Testing/Commissions URletter: httpss://news.ycombinator.com.tefect?id=49605246 Пункты: 15 # Комментарии: 0