SQS: Bayesian DN Complision через Sparse Quantized субдистрибуции

#Bayesian #Complision #Sparse #Quantized #Аннонс

arXiv: 2510,08999v2 Аннонс Тип: заменить резюме: Компрессирование крупномасштабных нейронных сетей имеет важное значение для внедрения моделей на устройствах, ограниченных ресурсами. В большинстве существующих методов смазка веса или низкобитная квантизация в отдельности, что зачастую приводит к неоптимальным коэффициентам сжатия для сохранения приемлемых показателей снижения эффективности. Мы внедряем единую систему для одновременного стирания и квантизации на основе байесовского вариативного обучения (\метод), которая обеспечивает более высокие показатели сжатия по сравнению с предыдущими базовыми показателями при сохранении сопоставимых показателей. Ключевая идея заключается в том, чтобы использовать скачок и плиту перед тем как вызвать квантовые весы модели с использованием гауссианских моделей смеси (ГММ) для обеспечения низкой точности. В силу непривлекаемости цели, связанной с пиковыми и соляными приводами к ГИМ, мы выбираем эффективное приближение, которое облегчает эффективную компрессию при минимальной точности. Теоретически, мы обеспечиваем последовательный результат для предлагаемого нами подхода к вариации sp

Компьютерные науки > Машинное обучение [представлено 10 октября 2025 года (v1), последнее пересмотренное 7 сентября 2026 года (эта версия, v2)) Название: SQS: Bayesian DN Complision через Sparse Quantized Sub-bributions View PDF HTML (экспериментальное) резюме: Сжимание крупномасштабных нейронных сетей имеет важное значение для внедрения моделей на устройствах с ограниченными ресурсами. В большинстве существующих методов смазка веса или низкобитная квантизация в отдельности, что зачастую приводит к неоптимальным коэффициентам сжатия для сохранения приемлемых показателей снижения эффективности. Мы внедряем единую систему для одновременного стирания и квантизации на основе байесовского вариативного обучения (\метод), которая обеспечивает более высокие показатели сжатия по сравнению с предыдущими базовыми показателями при сохранении сопоставимых показателей. Ключевая идея заключается в том, чтобы использовать скачок и плиту перед тем как вызвать квантовые весы модели с использованием гауссианских моделей смеси (ГММ) для обеспечения низкой точности. В силу непривлекаемости цели, связанной с пиковыми и соляными приводами к ГИМ, мы выбираем эффективное приближение, которое облегчает эффективную компрессию при минимальной точности. Теоретически, мы обеспечиваем последовательный результат для предлагаемого нами подхода к маломасштабной и квадратизированной глубокой нейронной сети. Обширные эксперименты на модели ResNet, BERT-базе, Llama3.2 и Qwen2,5 показывают, что наш метод…