Динамика обобщения в глубоком обучении
arXiv:2504.16450v4 Аннонс Тип: заменить резюме: мы вычисляем дифференциальное уравнение, которое регулирует эволюцию пробела в обобщении при обучении модели методами на основе градиентного спуска. Это дифференциальное уравнение определяется двумя ключевыми количествами: коэффициентом сокращения, который объединяет траектории, соответствующие несколько различным наборам данных, и фактором возмущения, в котором они обучаются на разных наборах. Сопутствующий срыв сокращения и возмущения гарантирует контролируемое накопление пробелов в обобщении во время обучения. Мы анализируем это дифференциальное уравнение, с тем чтобы показать, что разрыв в обобщении определяется квадратной формой, которая состоит из "эффективной матрицы Грама" и зависит от траектории обучения и определенного остаточного значения прогнозера при инициализации. Наши рамки применимы к общим глубоким сетям и бесперебойным функциям потерь. В численных экспериментах с различными архитектурами нейронной сети, наборами данных и размерами выборки мы показываем t