Реклама

Большие языковые модели для аннотации качества машинного перевода: проблемы людей и моделей

#Большие #Наши #arXiv NLP

arXiv:26101988v1 Вид уведомления: новое резюме: Большие языковые модели (МТС) считаются более эффективной и экономичной альтернативой человеческому суждению для оценки машинного перевода. С учетом того, что оценка МТ охватывает большое число языковых пар, областей и уровней аннулярной гранулатуры, МЛМ должны быть тщательно оценены по всем этим параметрам до их надежного использования в качестве альтернативы оценке человека. В настоящем документе мы оцениваем эффективность МЛМ для двух известных схем оценки качества МТ: многомерных показателей качества (ММК) и аннотаций ошибок с помощью анализа их согласия с людьми-аннотациями. Мы представляем результаты длинноконтекстового набора из 70 языковых пар и общедоступных данных WMT23 и WМТ25, в ходе которых изучаются как баллы, так и погрешности, распределенные между различными языковыми парами и областями. Наши результаты показывают, что в то время как соглашение LLM с людьми-аннотаторами выходит за рамки соглашения между аннуляторами человека для некоторых e

Компьютерные науки > Расчеты и язык [представлен 7 октября 2026 года] Название: Большие языковые модели для аннотации качества машинного перевода: Человечество и модели - оба вызова в HTML (экспериментальный) резюме: МОД рассматриваются как более эффективная и экономичная альтернатива человеческому мнению для оценки машинного письменного перевода. С учетом того, что оценка МТ охватывает большое число языковых пар, областей и уровней аннулярной гранулатуры, МЛМ должны быть тщательно оценены по всем этим параметрам до их надежного использования в качестве альтернативы оценке человека. В настоящем документе мы оцениваем эффективность МЛМ для двух известных схем оценки качества МТ: многомерных показателей качества (ММК) и аннотаций ошибок с помощью анализа их согласия с людьми-аннотациями. Мы представляем результаты длинноконтекстового набора из 70 языковых пар и общедоступных данных WMT23 и WМТ25, в ходе которых изучаются как баллы, так и погрешности, распределенные между различными языковыми парами и областями. Наши результаты свидетельствуют о том, что, хотя соглашение ЛЖМ с аннотаторами превышает согласие между людьми в отношении некоторых задач по оценке, оба эти соглашения существенно различаются во всех схемах аннуляции, языковых пар и областей и остаются ненадежными для большинства параметров. Кроме того, мы выявляем проблемы, с которыми сталкиваются как люди, так и аннотаторы ЛМ: людям особенно трудно столкнуться из-за тонкозернистых аббревиатур MQM и низкоресурсных…