ДипСиек-В4.1 Флэш: Нажатие на пределы KV Cach Complision TL; DR Когда DeepSeek-V4.1, Flash был выпущен, я подумала, что это может быть просто посттренировочная итерация... но после использования этого времени я обнаружила, что он достиг почти 420 Token/s в скорости, а потом Куй сказал, что все модели Deep Seeeq-V4. Pro будут выведены из эксплуатации. Вдруг мне стало казаться, что этот вопрос не имеет значения... пока технический доклад .DeepSEek V4.1-Flash: Продвинуть границы KV cache Компрессии[1], только тогда я понял, что его следует назвать DeepseeK-V5 Flask ... Как говорится в заголовке газеты, цель DeepSeek-V4.1 Флэша - довести давление KVCach до крайности. Основная причина в том, что агентские потоки с длинным горцом приводят к росту Контекста дольше и больше, тогда как различные звонки дают сильное давление перед наполнением. Давление KVCache в HBM и внешней SSD очень высокое, все из которых являются причинами, делающими масштабирование невозможным. В связи с этим была проведена серия оптимизации архитектуры модели, особенно в случае сжатия KVCache и оптимизации расчета предварительного заполнения. - Оптимизация вычислений: на основе YOCO вся модель состоит из 40 слоев, а во время предварительного наполнения требуется лишь 20 уровней. Таким образом, параметры активации перед наполнением всего лишь 8B, а параметры активированного Декода - 16В − KVCach cжатие: с инженерной точки зрения сжатие KVKache подразделяется на несколько размеров: сжатие головы по аналогии с…
Дип Сик-В4.1 Флэш: Противодействие ограничениям KV Cache Compression
Статья URL: https://zartbot.github.io/blog/model_arch/dsv41flash_ark/en.html Комментарий