Нет никакого смысла нанимать нобелевского лауреата, чтобы он отвечал на однотипные звонки в колл-центр. Примерно так же выглядит ситуация, когда повторяющуюся узкую задачу — разметить запись, проверить формат ответа, отнести обращение к одной из десяти категорий — отдают флагманской языковой модели через API.
Показательный пример — кейс Checkr, платформы проверки кандидатов. По данным Predibase, где модель дообучали, GPT-4 давал 87–88% точности на лёгких случаях и около 82% на «грязных» данных, а дообученная открытая модель на 8 млрд параметров показала более 90% на самых сложных 2% случаев; стоимость при этом, по заявлению компании, снизилась в 5 раз. Прежде чем делать выводы, разберём механику, цифры и границу применимости — со ссылками на первоисточники и оговорками там, где источник заинтересован в результате.
Что считать «карликовой» моделью
Чёткой границы в индустрии нет, поэтому берём рабочее определение из позиционной статьи NVIDIA: малая языковая модель — это модель, которая помещается на обычное потребительское устройство и обслуживает запросы одного пользователя с приемлемой задержкой. По состоянию на 2025 год под это определение подпадает большинство моделей до 10 млрд параметров. Это позиция авторов статьи, а не отраслевой стандарт. Для практики удобнее запомнить порядок величины: семейство «7–8 млрд параметров и меньше».