Компьютерные науки > Машинное обучение [представлено 16 сентября 2026 года] Название: Beyond Quadratic Probles: Схема стабилизационной фазы Adam View PDF HTML (экспериментальный) резюме: Скачки Loss являются периодическими неустойчивыми в обучении нейросетям и могут возникнуть из многочисленных механизмов. В частности, для Адама макроскопические пики потерь были связаны с оптимизирующей динамикой, однако вопрос о том, как эти два импульсных графика их регулирования остается неясным. Мы исследуем эту зависимость путем картирования динамики тренировок по плоскости доллара (\бета_1,\beta_2) долларов. Через ряд параметров модели-задач, приблизительно линейная граница, 1—\beta_2=C(1–# beta _ 1) $ отделяет пиковую от непиковой динамики, в то время как одномерная квадратичная потеря вызывает примерно кубический уклон. Одномерная сверхквадратическая потеря $L(x)\proptox>n долл. возвращает почти линейное масштабирование и увязывает пограничный коэффициент с фактическим показателем потерь в долларах США. Мы далее показываем, что уверенные потери в результате перекрестной антропии формируют ядро-стенный ландшафт с узким квадратным ядром и крутой стенкой, которая вызывает эффективное сверхквадратическое поведение в масштабе оптимизации обновления. В совокупности эти результаты связывают скачки потерь Адама как с несоответствием между динамическими режимами, так и суперквадратической геометрией конечных масштабов за пределами Гессианского региона. Текущий контекст просмотра: cs.LG ссылки…
Помимо квадрической потери: схема стабилизации Адама
arXiv: 2609.18314v1 Annuaire Type: New Humber Abstract: Spics of Disaster recurability in neural-network Training ( " Стражи потерь - это периодически повторяющаяся неустойчивость в обучении нервно-сетевым сетям &qt; ), которая может возникнуть из многочисленных механизмов. В частности, для Адама макроскопические пики потерь были связаны с оптимизирующей динамикой, однако вопрос о том, как эти два импульсных графика их регулирования остается неясным. Мы исследуем эту зависимость путем картирования динамики тренировок по плоскости доллара (\бета_1,\beta_2) долларов. Через ряд параметров модели-задач, приблизительно линейная граница, 1—\beta_2=C(1–# beta _ 1) $ отделяет пиковую от непиковой динамики, в то время как одномерная квадратичная потеря вызывает примерно кубический уклон. Одномерная сверхквадратическая потеря $L(x)\proptox>n долл. возвращает почти линейное масштабирование и увязывает пограничный коэффициент с фактическим показателем потерь в долларах США. Мы далее показываем, что уверенные потери в связи с перекрестной антропией создают ядро-стенный ландшафт, состоящий из узкого квадратного ядра и крутая стена, которая вызывает эффективное сверхквадратическое поведение в масштабе выбора