Оптимизация моделей речи в ходе обучения

#Оптимизация #Annuales #Type #Замена #Хотя

arXiv: 2601.13704v4 Annuales Type: Замена кросс-бюллетеня: При обучении речевым аппаратам модели нейронной сети обычно разрабатываются путем выбора архитектуры с фиксированными размерами и структурой слоя. Затем эти модели обучаются максимальному повышению эффективности показателей, соответствующих цели задачи. Хотя общая архитектура, как правило, основана на предварительном знании задачи, размеры отдельных слоев часто выбираются эвристически. Однако этот подход не гарантирует оптимального компромисса между показателями эффективности и вычислительной сложностью; следовательно, для снижения расчетных издержек обычно используются такие послеоперационные методы, как квантизация веса или стирка моделей. Это происходит потому, что стохастические методы градиентного спуска (СПГ) могут оптимизировать только различные функции, в то время как факторы, влияющие на вычислительную сложность, такие, как размеры слоя и операции в точке плавания в секунду (FLOP/s), не являются дифференциальной структурой и требуют изменения структуры модели во время обучения. Мы профи

Компьютерная наука > Звук [представлен 20 января 2026 (v1), последний пересмотренный вариант 15 сентября 2026 года (эта версия, v4)] Название: Performance and Incorputable-Off Оптимизация речевых моделей во время тренировки HTML (экспериментальное) резюме: В обучении речевым аппаратам модели нейронной сети обычно разрабатываются путем выбора архитектуры с фиксированными размерами и структурой слоя. Затем эти модели обучаются максимальному повышению эффективности показателей, соответствующих цели задачи. Хотя общая архитектура, как правило, основана на предварительном знании задачи, размеры отдельных слоев часто выбираются эвристически. Однако этот подход не гарантирует оптимального компромисса между показателями эффективности и вычислительной сложностью; следовательно, для снижения расчетных издержек обычно используются такие послеоперационные методы, как квантизация веса или стирка моделей. Это происходит потому, что стохастические методы градиентного спуска (СПГ) могут оптимизировать только различные функции, в то время как факторы, влияющие на вычислительную сложность, такие, как размеры слоя и операции в точке плавания в секунду (FLOP/s), не являются дифференциальной структурой и требуют изменения структуры модели во время обучения. Мы предлагаем метод репараметризации на основе впрыскивания шума, который позволяет совместно оптимизировать производительность и вычислительную сложность во время обучения с использованием методов БДД. В отличие от традиционных методов…