Компьютерные науки > Расчеты и язык [представлен 8 октября 2026 года] Название: " Advanceing English Classificers for LLM PDI PDF Pretraining Data View PDTHL (экспериментальный) Резюме: Последние достижения в области большой языковой модели (LLM) свидетельствуют о роли высококачественных данных об обучении в повышении эффективности работы. Хотя фильтрация на основе моделей доказала свою эффективность в выборе высококачественных подмножеств из веб-корпоры, особенно для языков с высоким уровнем ресурсов, низкоресурсные языки сталкиваются с проблемами ввиду ограниченного наличия аннотированных данных. В рамках этой работы изучается вопрос о распространении фильтрации качества на более чем 100 языков путем предложения многоязычного подхода к адаптации, который преобразует существующий английский классификатор качества в многоязычный вариант. Наш подход предполагает обучение небольшого многослойного перцептрона на вершине моделей, предназначенных только для трансформатора, с использованием многоязычного текста в качестве вводной информации и баллов, полученных от английских классификаторов, которые применяются к машинно-переведенному тексту как этикетки. Наши эксперименты по шкале 1В, 3B и 8B показывают, что наш подход поддерживает целевые показатели для фильтрации существующих многоязычных моделей на основе ПУР без ущерба для региональных и культурных критериев. Для дальнейшей оценки обобщения на разных языках мы сравниваем результаты классификации высококачественных…
Адаптация английских классификаторов качества для многоязыкового выбора данных предварительного обучения LLM
arXiv: 261 0111585v1 Вид уведомления: новое резюме: последние достижения в области подготовки кадров с использованием моделей большого языка (LLM) подчеркивают роль высококачественных данных об обучении в повышении эффективности работы. Хотя фильтрация на основе моделей доказала свою эффективность в выборе высококачественных подмножеств из веб-корпоры, особенно для языков с высоким уровнем ресурсов, низкоресурсные языки сталкиваются с проблемами ввиду ограниченного наличия аннотированных данных. В рамках этой работы изучается вопрос о распространении фильтрации качества на более чем 100 языков путем предложения многоязычного подхода к адаптации, который преобразует существующий английский классификатор качества в многоязычный вариант. Наш подход предполагает обучение небольшого многослойного перцептрона на вершине моделей, предназначенных только для трансформатора, с использованием многоязычного текста в качестве вводной информации и баллов, полученных от английских классификаторов, которые применяются к машинно-переведенному тексту как этикетки. Наши эксперименты по шкале 1В, 3B и 8B показывают, что наш подход поддерживает базовый уровень LLM ниже по течению существующих многоязычных моделей f