Слишком много убеждающих: как совместимый конфликт навыков в агентах по кодированию
arXiv: 2610.11647v1 Annuales Type: кросс-бюллетень: Кодирующие агенты получают навыки агента, каталоги которых SKILL.md сообщает модель когда и как выполнить задачу. Поскольку навыки поступают из независимых источников (группы, разработчики, подделки, копированные коллекции), установленные навыки могут быть совмещены с аналогичными навыками, выполняющими одну и ту же работу, а модель выбирает между ними только по имени и описанию. В случае конфликта установленные навыки теряют основные функции (например, запрет на трогание гита), поскольку аналогичные навыки используются вместо этого или изменяют то, что они делают. Задача по-прежнему не решена, и поэтому контрольные показатели, которые проверяют только выполнение задачи, пропускают такие случаи. Мы представляем первое эмпирическое исследование таких конфликтов. Из снимков 20 947 хранилищ, мы добываем 822 109 пар кандидатов на аналогичные навыки, имеем у судьи LLM стратифицированную выборку в 3 754 и прогоняем 312 пар на трех моделях (6368 запусков, 169 294 вызова инструментов, 542 часа агента). Мы сообщаем о пяти выводах. 1) Навыки, подверженные конфликтам, являются общими: