Гиперпараметрическое расширение законодательства по вопросам, связанным с разницей в МОС
arXiv: 2609.086990v1 Annuate Type: New Humber: Mixture of Experts (MoE) Models расширяет мощность моделей без пропорционального увеличения числа учебных вычислений, но увеличение спаржи затрудняет надежную передачу гиперпараметров. В ходе этой работы мы продемонстрировали, что для МОС с ультрапараметром обычных законов о масштабировании гиперпарометров недостаточно: оптимальные темпы обучения и размер партии варьируются в зависимости от коэффициента активации, и эти изменения не могут быть объяснены только общим или активированным числом параметров. Для того чтобы охарактеризовать эту зависимость, мы проводим 1800 предварительных прогонов по шести диапазонам и моделям активированного параметра с параметрами до 6B, не связанными с комплектованием, обрабатывая приблизительно 20 триллионов символов стоимостью 200 000 часов в эквиваленте H800 GPU. Наши результаты согласуются с противоречивыми выводами, сделанными в ходе предыдущей работы, путем выявления двух режимов масштабирования. При фиксированной спарсити оптимальный размер партии следует принципу правосубъектности и тренировочных знаков в долл. США, тогда как оптимальная доля обучения с профессиональной подготовкой