Компьютерные науки > Расчеты и язык [представлен 2 февраля 2026 (v1), последний пересмотренный вариант 16 сентября 2026 года (эта версия v2)) Название: HALT: Gallucination Assessment through Log-probs as Time series View PDF HTML (экспериментальное резюме): Галлюцинации остаются основным препятствием для крупных языковых моделей, особенно в критических областях безопасности. Мы представляем HALT (Оценку галлюцинации с помощью Log-probs в виде временных рядов), легкий детектор галлуцинаций, который использует только те 20 символических log-вероятностей из поколения LLM как временные ряды. В HALT используется встроенная повторная модель, сочетаемая с элементами на основе энтропии для изучения алгоритма калибровки модели, что является чрезвычайно эффективной альтернативой крупным кодерам. В отличие от подходов с использованием белого ящика, HALT не требует доступа к скрытому состоянию или картам внимания, опираясь только на вероятность выпуска. В отличие от подходов, основанных на использовании черного ящика, он действует скорее с помощью log-probs, чем текста модели поверхности, что позволяет обеспечить более высокую степень обобщения домена и совместимости с запатентованными МЛМ без требования доступа к внутренним весам. Для оценки эффективности работы мы внедряем HUB (Hallucination Entermination Universal Basic), который объединяет предыдущие наборы данных в десять возможностей, охватывающих как задачи по обоснованию (алгоритмические, общинные, математические, символические,…
HALT: Оценка галлюцинации с помощью лог-обследования в виде временных рядов
arXiv: 2602.02888v2 Annuales Type: заменить резюме: галлюцинации остаются основным препятствием для крупных языковых моделей (LMM), особенно в критических областях безопасности. Мы представляем HALT (Оценку галлюцинации с помощью Log-probs в виде временных рядов), легкий детектор галлуцинаций, который использует только те 20 символических log-вероятностей из поколения LLM как временные ряды. В HALT используется встроенная повторная модель, сочетаемая с элементами на основе энтропии для изучения алгоритма калибровки модели, что является чрезвычайно эффективной альтернативой крупным кодерам. В отличие от подходов с использованием белого ящика, HALT не требует доступа к скрытому состоянию или картам внимания, опираясь только на вероятность выпуска. В отличие от подходов, основанных на использовании черного ящика, он действует скорее с помощью log-probs, чем текста модели поверхности, что позволяет обеспечить более высокую степень обобщения домена и совместимости с запатентованными МЛМ без требования доступа к внутренним весам. Для оценки эффективности мы внедряем HUB (Hallucination Discription Universal standard), которая объединяет