Когда агент в проде ошибается, разбор в команде идёт по одному сценарию: «модель тупит», «промпт кривой», «у провайдера что-то с API». Особенно едкая версия спора — когда весь код вокруг модели написан тобой: виновата модель или всё-таки я? Я спорил так же, пока не начал разбирать отказы по одному, с логами и числами. Оказалось: агент падал не потому, что модель плохая, а по причинам, у которых есть имена.
Три эпизода из практики, все — при зелёных метриках.
- При заливке корпуса норм в векторную базу молча терялось 34% чанков: в базе осталось 6861 точка из 10 414, лог загрузки рапортовал «пропусков нет», а золотой набор вопросов был зелёный — проверочные вопросы просто не попадали в потерянные куски.
- Состязательный аудит нашёл 14 дефектов; половина — в моих собственных оценочных тестах. И все эти тесты горели зелёным.