Появление изменяющейся инвер-дирекции от нелинейности
arXiv: 2610.10.11063v1 Annuate Type: New Humber Brieft: Sclassing laws описывают совершенствование закона о полномочиях в работе моделей, включая размер и число параметров набора данных, однако их основополагающие механизмы не вполне понятны. Чтобы объяснить масштабирование счетчиков параметров, существующая теория позиционирует масштаб с точки зрения силы-закона с глубиной модели. В моделях линейного внимания такое масштабирование увязывается с спектром данных по законодательству о силе: они не могут избирательно подходить к соответствующим символам, эти модели учатся в соответствии с глобальной спектральной прочностью, при этом более сильные направления усвоены перед более слабыми. Однако крупные языковые модели могут быть весьма нелинейными. Здесь мы показываем, что нелинейное внимание приводит к обратному глубокому распаду потери во всех тестированных спектрах данных. Нелинейность позволяет уделять внимание выборочно соответствующим знакам, позволяя параллельно изучать сильные и слабые спектральные направления. Аналогичная концентрация между слоями мотивирует подключение к теореме центрального предела: общая ошибка между слоев устанавливает плато потери, а g