Может ли SGD справиться с шумом в тяжелом тайне?
arXiv: 2508,04860v2 Annuales Type: заменить перекрестное резюме: Стохастическое гладиентное происхождение (SGD) является краеугольным камнем широкомасштабной оптимизации, однако его теоретическое поведение в условиях сильного шума -- обычное для современного машинного обучения и повышения квалификации -- остается недостаточно понятным. В ходе этой работы мы тщательно изучаем вопрос о том, может ли ванильный ГРД без каких-либо адаптивных модификаций быть успешным при таких неблагоприятных стохастических условиях. Предположим, что только стохастические градиенты ограничили несколько долларов за 1-2 долл. США, мы установим четкие гарантии конвергенции для (прогнозируемого) SGD в выпуклых, сильно выпукло-выпущенных и неконвективных классах проблем. В частности, мы показываем, что ДГД достигает мини-максимальной оптимальной сложности выборки при минимальных допущениях в выпуклых и сильно выпукловые режимы: $\mathcal {O}(#varepsilon_ {p} {p'}) долл. США и $маткала {О} (\varepsion {-frack {p] {2(p-1)]} долларов соответственно). Для неконвертируемых целей в соответствии со стандартными стандартами и с ограниченной центральной суммой в долл. США