Кто на самом деле сломал вашего ИИ-агента: модель или обвязка?

#ИИ-агента #Когда #Свежая #Scale #Оказывается
Кто на самом деле сломал вашего ИИ-агента: модель или обвязка?

Когда агент в проде ошибается, спор идёт по кругу: модель тупит, промпт кривой, API виноват. Свежая работа Scale AI даёт отказам адрес — ребро между компонентами и сторону вины. Оказывается, «виновата модель» почти никогда не значит «чинить дообучением»: разбираю таксономию из 41 режима, каталог-выжимку и четыре своих отказа с числами — ни один не закрыт сменой модели. Читать далее

Когда агент в проде ошибается, разбор в команде идёт по одному сценарию: «модель тупит», «промпт кривой», «у провайдера что-то с API». Особенно едкая версия спора — когда весь код вокруг модели написан тобой: виновата модель или всё-таки я? Я спорил так же, пока не начал разбирать отказы по одному, с логами и числами. Оказалось: агент падал не потому, что модель плохая, а по причинам, у которых есть имена.

Три эпизода из практики, все — при зелёных метриках.

- При заливке корпуса норм в векторную базу молча терялось 34% чанков: в базе осталось 6861 точка из 10 414, лог загрузки рапортовал «пропусков нет», а золотой набор вопросов был зелёный — проверочные вопросы просто не попадали в потерянные куски.

- Состязательный аудит нашёл 14 дефектов; половина — в моих собственных оценочных тестах. И все эти тесты горели зелёным.