Когда кодовый агент решает задачу, сама LLM не редактирует файлы и не запускает тесты напрямую. Она работает через агентную оболочку, или, по-другому, харнесс. Она получает системные инструкции, выбирает инструменты, читает результаты их работы и решает, что делать дальше.
Поэтому одна и та же модель в разных агентах может показать разные результаты. Где-то ей удобнее искать по проекту, где-то она получает более понятные ошибки, где-то лучше управляется контекст длинной сессии. Даже небольшое различие в инструментах или системном промпте на десятках шагов превращается в заметную разницу на выходе.
Чтобы отделить качество модели от качества оболочки, мы запускали одинаковые модели с одинаковым уровнем рассуждений в Koda, OpenCode, KiloCode, Claude Code и Ouroboros.
Для сравнения агентных оболочек мы выбрали модель DeepSeek V4 Flash и запустили её с одинаковыми уровнями рассуждений в нескольких харнессах. Замеры харнессов совсем не дешевое занятие, поэтому мы выбрали бюджетную модель, которая очень популярна на Open Router. И оказалось, что она как родная работает с нашим харнессом. На уровне Max оболочка Koda показала следующий результат: