LatentMD: Контрольные параметры поломок границы в текстовом тексте LLM
arXiv: 2609.06993v1 Annualce Type: кросс-бюллетень: Большие языковые модели (LMM) все чаще генерируют маркировку, потребляемую производителями, агентами, экстракторами кодов и структурированными трубопроводами вниз по течению. Вместе с тем существующие оценки часто соотносятся между качеством содержания и соблюдением формата, в результате чего погрешности при разметке границ " Отметкадаун &qt; недооцениваются. Мы представляем LatentMD, базовый и оценочный протокол для диагностики ограждений на уровне общего марка-приграничных сбоев в маркировке LLM. LatentMD отделяет правильность содержания от пограничной точности, что позволяет обнаруживать результаты, которые являются корректными с содержанием, но разрушаемыми. Этот контрольный показатель включает в себя 4179 запросов и КЛИ для оценки произвольных результатов модели. Из 9 МЛМ и примерно 37 600 поколений мы видим, что погрешности в разметке границ широко распространены: 38,0% действительных основных сетчатых выходов корректны на содержание, но разрушены границы, при этом значительные нарушения границ происходят неуточненными сигналами и в небольшом наборе подтверждений, который был утвержден человеком. Показания t