Эквивалентность нарушает уровень обучения
arXiv: 2609.083881v1 Annualce Type: New Humber: Equivariant Network обычно обучаются вместе с Адамом, однако в последних рабочих отчетах говорится о том, что такие матричные оптимизаторы, как Muon, могут лучше работать на этих архитектурах без объяснения причин. Мы идентифицируем один источник этой разницы внутри равномерных линейных слоев. Каждый блок изменяет матрицу канала $W_1 долл. США, делая его компоненты на 2 л+ 1 долларов, что дает расширенную карту $0 Вт _l \ otimes I_ {2л+1}$. Для одного применения слоя градиент в размере 2 долл. США + 1 долл. Адам меняет размеры весов, хранящихся в отдельности без использования неприкосновенных границ, так что один коэффициент обучения может создавать различные спектральные размеры шагов по блокам внутри слоя. Мы устраняем это несоответствие путем нормализации каждого блока обновления отдельно, без введения нового гиперпараметра. Это меняет только масштаб обновления, оставляя оценки момента Адама без изменений и его направление в каждом блоке. Мы оцениваем