Оценка контекстуального понимания моделей крупных языков

#Оценка #Annuate #Type #Humber #Abstract

arXiv: 2609.09004v1 Annuate Type: New Humber Abstract: Major Language Models (LMS) демонстрирует впечатляющие результаты в различных задачах НЛП, однако их способность проявлять подлинно контекстуальное понимание остается неопределенной. Традиционные оценочные показатели, такие как недоразумение, билингуальное исследование по оценке (БНОУ) или точность на уровне поверхности не позволяют выявить то, насколько хорошо МЛМ извлекают, интегрируют и рассуждают над контекстуальной информацией - особенно критический пробел в ответах на вопросы, когда модели должны согласовывать ответы с контекстуально обоснованными знаниями, а не заученными ассоциациями. Мы предлагаем новую систему оценки, основанную на графике знаний и предусматривающую использование семантичной структурной сходства для KG (S3KG), гибридной меры по обеспечению схожего структурного и семантического сходных показателей в рамках непрерывной оценки наряду с диагностической системой классификации ошибок в рассуждениях. Для подтверждения правильности этого трубопровода мы оцениваем S3KG по установленным параметрам на контрольном параметре ответов на вопросы (QA),

Компьютерные науки > Расчеты и язык [представлен 8 сентября 2026 года] Название: Оценка понимания контекста в больших языковых моделях Вид HTML (экспериментальный) Резюме: Большие языковые модели (МОД) демонстрируют впечатляющие результаты по различным задачам НЛП, однако их способность проявлять подлинно контекстуальное понимание остается неопределенной. Традиционные оценочные показатели, такие как недоразумение, билингуальное исследование по оценке (БНОУ) или точность на уровне поверхности не позволяют выявить то, насколько хорошо МЛМ извлекают, интегрируют и рассуждают над контекстуальной информацией - особенно критический пробел в ответах на вопросы, когда модели должны согласовывать ответы с контекстуально обоснованными знаниями, а не заученными ассоциациями. Мы предлагаем новую систему оценки, основанную на графике знаний и предусматривающую использование семантичной структурной сходства для KG (S3KG), гибридной меры по обеспечению схожего структурного и семантического сходных показателей в рамках непрерывной оценки наряду с диагностической системой классификации ошибок в рассуждениях. Для подтверждения правильности этого трубопровода мы оцениваем S3KG по установленным параметрам на основе контрольного показателя, полученного в ответ на вопросы (QA), демонстрируя его эффективность с точки зрения измерения точности, верности и интерпретируемости ответов, полученных в рамках LLM. История представления: Pragatheswaran Vipulanandan [видеть по электронной почте] [v1] Tue, 8…