SparKV: Загрузка KV-каша с навесом для эффективного приведения в действие LLM
arXiv: 2604.21231v3 Тип уведомления: заменить перекрестное резюме: эффективное заключение для включенных в систему крупных лингвистических моделей (LMS) по-прежнему сопряжено с трудностями из-за ограниченности аппаратных ресурсов и высокой стоимости предварительной стадии заполнения, которая обрабатывает весь контекст ввода данных для создания тайников Key-Value (KV). Мы представляем SparKV, адаптивную систему загрузки KV, которая сочетает облачный поток KV с вычислениями на устройстве. SparKV моделирует стоимость отдельных кусочков KV и решает, следует ли показывать или рассчитать каждый кусочек на месте при одновременном дублировании двух способов исполнения для сокращения запоздалости. Для устранения колебаний в беспроводном подключении и доступности ресурсов на грани, SparKV дополнительно совершенствует офлайновые графики во время работы с целью перебалансировки расходов на связь и расчеты. Эксперименты по различным наборам данных, МЛМ и кромочным устройствам показывают, что SparKV сокращает время до первого сигнала на 1,3 долл. США x-5,1x с незначительным воздействием на качество реагирования при одновременном снижении потребления энергии в расчете на один запрос на 1,5х-к