Когда неправильный ключ побеждает: понимание и обнаружение галлюцинаций в МЛМ
arXiv:2609.15106v1 Annuate Type: New Habstractive: Большие языковые модели могут галлюцинировать даже тогда, когда уже имеются знания, необходимые для правильного ответа. Мы изучаем эту неудачу с помощью скрытого подхода к выводам, когда выбор ответов зависит от конкуренции между ассоциациями, приобретенными в ходе предварительной подготовки. Мы показываем, что типовые прогнозы могут быть весьма чувствительны к индивидуальным ключевым словам запросов, что эти влиятельные ключевые слова имеют обязательную силу для конкретного образования и что их последствия систематически определяются периодичностью предварительной подготовки. Множественные связующие устройства могут также конкурировать и проявлять взаимодействие более высокого порядка в рамках одного и того же запроса. Основываясь на этом механизме, мы внедряем двухэтапный метод определения галлюцинаций. Устраняя влиятельные ключевые слова и измеряя, каким образом модель реорганизует свое прогнозирование, этот метод отличает ошибки, вызванные вводом в заблуждение ключевых ассоциаций от правильных решений, подкрепленных диагностическими доказательствами. В рамках различных моделей и контрольных показателей