Кто хоть раз просил языковую модель написать пост или статью, видел одну и ту же картину. Вводный абзац с общим тезисом, несколько подзаголовков, список преимуществ, вывод, который пересказывает начало. Если ИИ для создания контента пользуются многие авторы одной ниши, лента быстро заполняется текстами, которые различаются темой, но не устройством. Читатель это замечает раньше, чем успевает сформулировать, что именно не так.
Ниже разберу, откуда берётся эта схожесть, и покажу, как её измерить кодом: на уровне слов, на уровне корпуса и на уровне структуры. Измерение полезно не ради отчёта. Пока похожесть нельзя посчитать, спор о том, «шаблонный» ли текст, остаётся спором вкусов, а с цифрой на руках его можно сделать проверкой перед публикацией.
Почему ответы модели сходятся к одному шаблону
Первая причина лежит в декодировании. Модель на каждом шаге выбирает следующее слово из распределения вероятностей, и при обычных настройках температуры и top‑p выигрывают самые вероятные продолжения. Для похожих запросов самые вероятные продолжения тоже похожи, поэтому два автора, попросившие «статью про продвижение в соцсетях», получают тексты одного покроя, даже если формулировки запросов слегка различались.