Помимо частотных показателей: Могут ли контекстуальные вставки отражать изменения в научных текстах?

#Помимо #Могут #Annualce #Type #Brieflow

arXiv: 2609.18804v1 Annualce Type: New Brieflow: Выявление технологических тенденций является ключевой сайентометрической задачей, однако традиционные подходы на основе частот не позволяют зафиксировать существенные изменения смысла терминов в домене. Мы предполагаем, что контекстуальные установки могут дополнять частотную динамику для эффективного отслеживания диахронных семантических изменений. Мы сравниваем подходы, основанные на частоте и использовании астрофизики и NLP Corpora в период с 2010 по 2024 год. Потенциальные термины извлекаются с использованием KeyBERT (интилизация SciBert в качестве основной языковой модели) и фильтруются для значительного увеличения частоты с помощью точного теста Фишера. Затем эти термины оцениваются на предмет реального семантического изменения экспертами по доменам в целях установления знаков, указывающих истину. Для количественной оценки семантического дрейфа каждый термин, встраивающий "облака" из двух дискретных периодов, сопоставляется по нескольким параметрам: косинусное расстояние, среднее расстояние между парами, гостиничный тип T 2 и максимальное среднее расхождение. Результаты

Компьютерные науки > Расчеты и язык [представлен 16 сентября 2026 года] Название: " Помимо частотных мер: Могут ли контекстуальные вставки отражать изменения в научных текстах? Обзор PDF Резюме: Выявление технологических тенденций является ключевой сайентометрической задачей, однако традиционные подходы на основе частотных параметров не позволяют отразить существенные изменения значения терминов в домене. Мы предполагаем, что контекстуальные установки могут дополнять частотную динамику для эффективного отслеживания диахронных семантических изменений. Мы сравниваем подходы, основанные на частоте и использовании астрофизики и NLP Corpora в период с 2010 по 2024 год. Потенциальные термины извлекаются с использованием KeyBERT (интилизация SciBert в качестве основной языковой модели) и фильтруются для значительного увеличения частоты с помощью точного теста Фишера. Затем эти термины оцениваются на предмет реального семантического изменения экспертами по доменам в целях установления знаков, указывающих истину. Для количественной оценки семантического дрейфа каждый термин, встраивающий "облака" из двух дискретных периодов, сопоставляется по нескольким параметрам: косинусное расстояние, среднее расстояние между парами, гостиничный тип T 2 и максимальное среднее расхождение. Результаты показывают, что методы на основе частоты несколько лучше соответствуют человеческим суждениям о "терминах тренда", чем семантические метрики (Precision@50 0.62 vs 0.60 в астрофизике). Эти два…