Чтение между линиями: Может ли МГМ открыть вопрос, стоящий за текстом?

#Чтение #Может #Annualce #Type #Brieflook

arXiv: 2609.19070v1 Annualce Type: New Brieflook: Настоящий документ представляет собой "вопросную археологию" - конкретную задачу по оценке, которая сосредоточена на определении единственного подлинного "генезиса", который послужил основанием для создания полного текста. Отличимые от поколения вопросов, которое нацелено на любой правдоподобный вопрос или рамки дискурса, которые моделируют действия на уровне высказываний, наша задача оценивает понимание моделью авторского намерения. Мы представляем новый набор данных заказанных текстов в сочетании с их первоначальными исследовательскими вопросами и вероятными отвлекателями. Наша оценка обеих запатентованных моделей, таких как Gemini Flash и Pro, а также открытых исходных моделей, например Mistral и Qwen, свидетельствует о значительном прогрессе в решении этой задачи: более новые версии превосходят предыдущие, тогда как модели на основе BERT работали плохо. В частности, наши выводы свидетельствуют о том, что нынешние МЛМ превосходят человеческие показатели в этой области, и это свидетельствует об углублении понимания авторского намерения. Эта способность имеет важные последствия для АИ

Компьютерные науки > Расчет и язык [представлено 22 июля 2026 года] Название: Чтение между линиями: может ли МЛМ открыть вопрос за текстом? Вид PDF HTML (экспериментальное) Резюме: В настоящем документе предлагается "вопрос археология", конкретная задача по оценке, сосредоточенная на определении единственного, подлинного "генезиса вопроса", который послужил основанием для создания полного текста. Отличимые от поколения вопросов, которое нацелено на любой правдоподобный вопрос или рамки дискурса, которые моделируют действия на уровне высказываний, наша задача оценивает понимание моделью авторского намерения. Мы представляем новый набор данных заказанных текстов в сочетании с их первоначальными исследовательскими вопросами и вероятными отвлекателями. Наша оценка обеих запатентованных моделей, таких как Gemini Flash и Pro, а также открытых исходных моделей, например Mistral и Qwen, свидетельствует о значительном прогрессе в решении этой задачи: более новые версии превосходят предыдущие, тогда как модели на основе BERT работали плохо. В частности, наши выводы свидетельствуют о том, что нынешние МЛМ превосходят человеческие показатели в этой области, и это свидетельствует об углублении понимания авторского намерения. Этот потенциал имеет важные последствия для роли МА в выполнении задач, требующих нюансированного толкования человеческого общения. Таким образом, наша работа обеспечивает новые рамки и сложные ориентиры для будущих моделей. Загрузка ссылок и цитат...…