Таксономия языков программирования для поколения кодов

#Таксономия #Annualce #Type #Joshi #Аналогичная

arXiv:2604.0239v3 Annualce Type: заменить резюме: 7000+ языков мира сильно различаются в плане наличия ресурсов для НЛП, стимулируя усилия по систематической классификации их по степени находчивости (Joshi et al., 2020). Аналогичная разница существует и в языках программирования (ПМС); однако не было установлено ни одного таксономии с уровнем ресурсов для целей разработки кодекса. По мере того, как крупные языковые модели (ММЛ) становятся все более способными генерировать коды, такая таксономия приобретает важное значение. Для заполнения этого пробела мы представляем первую воспроизводимую классификацию ресурсов ПЛ, сгруппировав 646 языков на четыре уровня. Мы показываем, что только 1,9% языков (Tier 3, High) составляют 74,6% от всех символов в семи крупнейших корпорациях, а 71,7% из них (Thier 0, Scarce) — всего лишь 1%. Статистический анализ неравенства, дисперсии и распределения в пределах уровня подтверждает, что этот дисбаланс носит как экстремальный, так и систематический характер. Наши результаты обеспечивают принципиальную основу для обработки наборов данных и обеспечения уровня знаний

Компьютерная наука > Расчет и язык [представлен 31 марта 2026 года (v1), последний раз пересмотренный 16 сентября 2026 (эта версия, v3)] Название: A таксономия языков программирования для шифрования поколения PDF HTML (экспериментальный) Резюме: 7000+ языков мира сильно различаются в плане наличия ресурсов для НЛП, стимулируя усилия по систематической классификации их по степени находчивости (Joshi et al., 2020). Аналогичная разница существует и в языках программирования (ПМС); однако не было установлено ни одного таксономии с уровнем ресурсов для целей разработки кодекса. По мере того, как крупные языковые модели (ММЛ) становятся все более способными генерировать коды, такая таксономия приобретает важное значение. Для заполнения этого пробела мы представляем первую воспроизводимую классификацию ресурсов ПЛ, сгруппировав 646 языков на четыре уровня. Мы показываем, что только 1,9% языков (Tier 3, High) составляют 74,6% от всех символов в семи крупнейших корпорациях, а 71,7% из них (Thier 0, Scarce) — всего лишь 1%. Статистический анализ неравенства, дисперсии и распределения в пределах уровня подтверждает, что этот дисбаланс носит как экстремальный, так и систематический характер. Наши результаты обеспечивают принципиальную основу для обработки наборов данных и оценки многоязычных МЛ. История представления: Md Nishat Raihan [видение электронной почты] [v1] Tue, 31 марта 2026 21:05:39 UTC (544 KB) [ v2] Tue, 7 Apr 2026 18:18:00 UTS (545 KB)] Wed, 16 Sep 2026 17:40:29 UTK (539…