Kodacode лучший харнес для DeepSeek v4 Flash!? Замерили различные харнессы и модели

#Kodacode #DeepSeek #Flash #Замерили #Koda
Kodacode лучший харнес для DeepSeek v4 Flash!? Замерили различные харнессы и модели

Мы запустили DeepSeek V4 Flash в четырёх популярных харнессах. В наших замерах Koda набрала 52,2% и обошла Kilocode, Claude Code и OpenCode. В статье рассказываем, как устроили эксперимент, почему одна и та же модель показывает разные результаты и что именно помогает агенту решать больше реальных задач. Читать далее

Когда кодовый агент решает задачу, сама LLM не редактирует файлы и не запускает тесты напрямую. Она работает через агентную оболочку, или, по-другому, харнесс. Она получает системные инструкции, выбирает инструменты, читает результаты их работы и решает, что делать дальше.

Поэтому одна и та же модель в разных агентах может показать разные результаты. Где-то ей удобнее искать по проекту, где-то она получает более понятные ошибки, где-то лучше управляется контекст длинной сессии. Даже небольшое различие в инструментах или системном промпте на десятках шагов превращается в заметную разницу на выходе.

Чтобы отделить качество модели от качества оболочки, мы запускали одинаковые модели с одинаковым уровнем рассуждений в Koda, OpenCode, KiloCode, Claude Code и Ouroboros.

Для сравнения агентных оболочек мы выбрали модель DeepSeek V4 Flash и запустили её с одинаковыми уровнями рассуждений в нескольких харнессах. Замеры харнессов совсем не дешевое занятие, поэтому мы выбрали бюджетную модель, которая очень популярна на Open Router. И оказалось, что она как родная работает с нашим харнессом. На уровне Max оболочка Koda показала следующий результат: