Интерфейс-программа KV Cach Quantization for Dense On-Chip NMV в длинноконтексте LLM Декодирование
arXiv: 2609.05764v1 Annulates Type: кросс-бюллетень: Кэш с ключевым значением (KV) является доминирующим узким местом памяти в длинноконтекстовой большой языковой модели (LLM): каждый шаг читает его полностью, так что декодирование - это связь между лентами памяти и памятью. Держа квантизированный КВ-каш в плотной нелетающей памяти (NVM) удаляет передачу от чипов. Однако существующие методы квантизации KV были разработаны для систем памяти в стиле GPU: KIVI прикрепляет метаданные по каждой группе, добавляя около 25% к хранимому КВ-кашу; KVQuant сохраняет небольшие высотные значения точности, которые плотный массив не может удержать на месте. В настоящем документе рассматривается стоимость этих структур, когда кэш KV находится в NMV за преобразователями с фиксированным диапазоном, и разрабатывается схема квантизации, соответствующая этому интерфейсу. Архитектура хранит квантизированный КВ-каш в плотной NVM на chip, использует небольшой статический аналоговый крестик только для фиксированного вращения и следит за цифровой логикой. Произвольная вращение и нормализация поведения пер-вектора дают каждому кору.