Neyshakar: Open Persian Read-Spech Corpus для автоматического распознавания речи

#Neyshakar #Open #Persian #Read-Spech #Corpus

arXiv:2609.14542v1 Annualce Type: новый резюме: Neyshecar представлен в виде открытого персидского чтё-списка, предназначенного для освещения как формального, так и неофициального языка, названных субъектов и более длинных высказываний. В версии 6 62 279 проверенных записей общей продолжительностью 99,02 часа предоставляются 190 вкладчиками с 34 541 конкретной записью. Этот пул был собран из написанных людьми материалов, контекстуализированных гомографов и просмотра составленного с использованием языковых моделей текста. Текстовые записи были нормализованы с библиотекой Шекара, которая поддерживает как формальный, так и неформальный персидский формат, а каждая представленная запись рассматривалась на основе общей рубрики подтверждения. Примерно 24% выпущенных клипов классифицируются автоматическим классификатором как неофициальные; эти регистрационные этикетки не являются действительными для человека. Для воспроизводимой оценки по соглашению используются знаки рейтинга уровня товара, непрозрачные идентификаторы каждого участника слипов делают диспропорциональную разбивку респондента поддающейся проверке и поддерживают неопределенность в разбивке по вкладчикам