Компьютерные науки > Машинное обучение [представлено 16 сентября 2026 года] Название: Повторный просмотр дистрибутивного подхода к снижению разницы на основе знаков PDF HTML (экспериментальный) Резюме: Методы, основанные на подписании, сокращают расходы по связи в распределенной среде, но агрегирование местных знаков может привести к искажению при неоднородности данных. В результате этого существующие методы сокращения разницы на основе знаков не позволяют добиться оптимальных темпов сближения. В настоящем документе мы решим эту проблему и получим оптимальные ставки как для невыпущенной стохастики, так и для оптимизации конечной суммы. Сначала мы дадим контрпример, показывающий, что большинство голосов может не приближаться к стационарным пунктам даже с точными местными уклонами. Исходя из этого ограничения, мы предлагаем отследить глобальный градиент на сервере посредством беспристрастного сжатия рекурсивных приращений. В результате, мы можем получить конвергенцию в размере $O(sqrt {d/K}+ sqrт d (a/(nK)) {1/3} долл. США за $\ll_1-Norm и $ O(skrt#а/К}+sqirt a/(NK)¶[1/3)] долларов за USL_2-norm. Здесь, $K$ - это итерационный номер, n долл. США - число рабочих, USD - размер, а $a=1+omega$, при этом $\omega$ означает относительную вариацию компрессора. В случае проблем с конечной суммой компонентов M$ мы комбинируем периодическое точное обновление градиента с сжатыми различиями по компонентам. В результате этого общая сложность выборки составляет $O(M+d\sqrt {aM}/epsilon__ {-2}…
Повторное рассмотрение вопроса о сокращении разницы в показателях на основе знаков
arXiv:2609.18656v1 Сообщение типа: новое резюме: методы, основанные на признаках, сокращают расходы по связи в различных средах, однако агрегирование местных знаков может привести к перекосам при неоднородности данных. В результате этого существующие методы сокращения разницы на основе знаков не позволяют добиться оптимальных темпов сближения. В настоящем документе мы решим эту проблему и получим оптимальные ставки как для невыпущенной стохастики, так и для оптимизации конечной суммы. Сначала мы дадим контрпример, показывающий, что большинство голосов может не приближаться к стационарным пунктам даже с точными местными уклонами. Исходя из этого ограничения, мы предлагаем отследить глобальный градиент на сервере посредством беспристрастного сжатия рекурсивных приращений. В результате, мы можем получить конвергенцию в размере $O(sqrt {d/K}+ sqrт d (a/(nK)) {1/3} долл. США за $\ll_1-Norm и $ O(skrt#а/К}+sqirt a/(NK)¶[1/3)] долларов за USL_2-norm. В данном случае, $K долларов - это итерация, USD - количество рабочих, `$d's размер, а $a=1+omega$ с $\omega долл. d