Реклама

Оптимизация моделей большого языка с цепными ЖИО

#Оптимизация #Annuatet #Type #Humber #Brieflow

arXiv:2610199775v1 Annuatet Type: New Humber Brieflow: Muon мотивировал растущую семью оптимизаторов, которые составляют несколько матричных нормализаций, но эти методы остаются фрагментированными и не имеют единой перспективы. Мы внедряем цепные линейные минимизированные ораклы (связанные ЖИО), которые представляют эти методы как составы ЖИО. Несмотря на их эмпирический успех, многие цепи выходят за рамки стандартной системы ЖИО и могут расходиться в отношении бесперебойных целей. Чтобы объяснить, почему состав тем не менее может помочь, мы переходим к линейной ассоциативной памяти и показываем, что цепная связь может улучшиться над Муоном под анизотропными привязками. Эмпирически мы предлагаем TensorChain, новенький оптимизатор в рамках, который сбрасывает совместимые весовые матрицы между различными слоями и нормализует 3d tensor через свои оси. В Qwen3 0,6B и 1.7B Предварительная тренировка TensorChain опережает все цепные исходные условия с средней эффективностью символов при средней номинальной экономии в 9,6% по отношению к Muon при соответствующем подтверждении потери.