На каждый язык свой токенизер: модульные токенизаторы для эффективного многоязыкового МПМ

#Annuate #Type #Habrial #Multilitary #Language

arXiv: 26009.15528v1 Annuate Type: New Habrial: Multilitary Language Models (LMS) традиционно опирается на единый словарь, разделяемый всеми поддерживаемыми языками, что может привести к неравномерному сжатию по всем языкам. Кроме того, их крупные матрицы ввода и вывода способствуют более широкому использованию памяти и медленному принятию решений, в частности для маломасштабных моделей. Он также является расточительным, поскольку модели часто используются только для подмножества языков. Для решения этих вопросов мы ввели модульную основу для многоязычной типовой подготовки. Во-первых, мы предлагаем методы изучения больших модульных символов BPE и Unigram, которые позволяют экстракции субтокененизаторов с учетом любого подмножества языков. Эти субкетизаторы обеспечивают сжатие наравне с моноязычными символизаторами и способствуют обеспечению справедливости в межъязычной сфере. Во-вторых, мы разрабатываем стратегию предварительной подготовки, в рамках которой образцы субтенекторов образуют партии, ограничивая прогнозы соответствующей подмножкой словаря и позволяя эффективно обучаться несмотря на большой словарь. Это способствует эффективному осуществлению