Меня зовут Влад, я фуллстек-разработчик в Selectel. Есть распространенное мнение, что для серьезной агентской разработки хорошо подходят только коммерческие модели вроде Claude и ChatGPT, а open-source модели всегда остаются на вторых ролях. В реальном корпоративном проекте выбор устроен сложнее: в первую очередь думаешь, что можно модели передать, а уже потом — какую модель использовать.
В моих сценариях внешние модели я использую для ресерча и AI-ассиста на данных, за которые можно не переживать, а задачи с закрытым кодом или внутренней документацией выполняются с self-hosted GLM внутри управляемого контура. В статье расскажу, как harness делает такой внутренний контур практически применимым и как оптимизировать итоговый процесс в гибридном режиме.
Что именно проверялось
Публичные бенчмарки отражают общий уровень моделей (не всегда честно) и при этом далеко не всегда говорят о качестве в повседневных задачах. Входные данные подготовлены заранее, содержат полный и достаточный контекст. Нередко тесты бенчмарков слиты в сеть, и на решениях этих тестов обучают новые модели, что значительно уменьшает полезность публичных бенчмарков. Минусов достаточно, и достоверного бенчмарка, который бы меня устроил, я пока не нашел.