Самозащитное внимание к компрессионному результату долгосоставного LLM

#Самозащитное #Annuate #Type #Sparse #Существующие

arXiv:2609.13205v1 Annuate Type: кросс-бюллетень: Sparse dolly-context вывод требует эффективного поиска символов как в предзаправке, так и декодировании. Существующие методы часто используют различные стратегии поиска на этих двух этапах, что не позволяет повторно использовать одно представление о поиске в течение всего периода. Мы предлагаем самоуважение, без подготовки кадров на основе совместного трансформационного представления знака-мощности. Ключевые знаки служат многоразовым символическим индексом для группового предварительного отбора и поиска декода, в то время как такое же представление по-прежнему совместимо с внешним компрессионным кодом KV-каша без отдельных указателей метаданных. Этот 1-битный индекс позволяет эффективно находить информацию с помощью битумных операций, которые широко поддерживаются современными ускорителями. При 5-процентной плотности внимания, самовлюбленное внимание остается близко к плотному вниманию на LongBench и RULER и достигает до 6,1x предварительного заполнения и 10.3х декодирующих ускорителей. Эксперименты с турбоквантом и гиперсъемкой SeekV4-Flash