MetaKV: Адаптивное сжатие KV Cache для конструированных LLM
arXiv: 2609.07966v1 Annuales Type: New Humber: Cea-cost (KV) компрессия кэша является эффективным способом сокращения накладных расходов памяти, связанных с выводом большой языковой модели (LLM), особенно в отношении длинных текстовых нагрузок. Однако существующие методы сжатия делают различные компромиссы между точностью, запоздалостью и пиком использования KV памяти, делая единую фиксированную конфигурацию непригодной для различных сигналов и ограничений ресурсов. Мы введем MetaKV, адаптивную систему, которая выбирает конфигурацию KV для сжатия кэша для каждого ввода данных на основе выбранной пользователем запоздалости и пиковых бюджетов памяти. MetaKV использует легкие модели прогнозирования для оценки запоздалости, пиковой памяти и вероятности правильной реакции по каждой конфигурации, а также выбирает конфигурацию, которая лучше всего удовлетворяет ограничения латентности-память при сохранении точности. Мы оцениваем МетаКВ по десяти конфигурациям с помощью трех репрезентативных методов сжатия кэшов KV, KVQuant