Диспетчерское внимание как диагностический сигнал для галлюцинации в крупных языковых моделях
arXiv: 2609.18320v1 Тип уведомления: новое резюме: Большие языковые модели (LMS) часто демонстрируют галлюцинации, что является серьезным барьером на пути к надежности при выполнении сложных задач по обоснованию. Хотя традиционные методы обнаружения основаны на показателях доверия, основанных на выпуске, эти логины часто неправильно классифицируются современными методами согласования. В настоящем документе мы изучаем временнóй изменчивость внутренних механизмов внимания в качестве альтернативного диагностического сигнала для галлюцинации, который не зависит от калибровки выходных данных. Вводя неконтролируемую метрику дисперсии внимания, мы показываем, что эпистемическая неопределенность оставляет измеримый след в промежуточных слоях, где резкие энтропия внимания ассоциируются с рассудками. Мы оцениваем наш подход к математическим расчетным показателям (GSM8K и MTH-500) с использованием семейства моделей Qwen2,5 (определения 1,5B и 3B), найдя статистически значимые улучшения AUC в размере до +0,076 по сравнению с базовыми показателями, основанными на выпуске, во всех испытанных condi