Фатом: " Глубина для чтения на основе скоба &qt; для разшифровки в неразгруженном KV

#Фатом #Глубина #Annualce #Type #Humber

arXiv: 2609.17652v1 Annualce Type: New Humber Brieflow: Когда агентские сеансы проходят к миллиону символов с множеством сеансов одновременно, КВ-каша и индекс, который он занимает в памяти хоста, и сканирование, которое ранжирует все n ключи для этапа сверх k становится трафиком, граничащим декодирование. Мы представляем Фатом, сканирование ключей, в котором каждый запрос определяет количество бит каждого ключевого канала для чтения. 4-битный кэш K хранится в качестве канала - основной как бит самолёты, так что префикс t плоскостей — это точно T-bit quantizer, и запрос расходует свой бюджет на бит, заливая воду по отношению к значению своих каналов с разницей. При миллионе жетонов на Qwen3-8B декодирующий этап 1,67x в GPU время быстрее чем при 136-битном сканировании Double Sparsity, Loki и SparQ r=32, а также в то же время, что и 68- битное чтение Sparqua (r = 16) Fatom читает 18% меньше байтов с погрешностью внимания на 6 из семи моделей и контекстных настройок. На заданиях в стиле RULER каждое сканирование соответствует точному декодированию топ-к, а

Компьютерные науки > Машинное обучение [представлено 15 сентября 2026 года] Название: Fathom: Per-QueryRead Defth for Sparse Decoding Offsed KV Caches View PDF HTML (экспериментальный) Резюме: Когда агентские сеансы проходят до миллиона символов с множеством сеансов одновременно, кэш KV и индекс, который его ранжирует в памяти хоста, а сканирование, которое помечает все n ключи для этапа сверху k становится трафиком, граничащим декодирование. Мы представляем Фатом, сканирование ключей, в котором каждый запрос определяет количество бит каждого ключевого канала для чтения. 4-битный кэш K хранится в качестве канала - основной как бит самолёты, так что префикс t плоскостей — это точно T-bit quantizer, и запрос расходует свой бюджет на бит, заливая воду по отношению к значению своих каналов с разницей. При миллионе жетонов на Qwen3-8B декодирующий этап 1,67x в GPU время быстрее чем при 136-битном сканировании Double Sparsity, Loki и SparQ r=32, а также в то же время, что и 68- битное чтение Sparqua (r = 16) Fatom читает 18% меньше байтов с погрешностью внимания на 6 из семи моделей и контекстных настройок. На заданиях в стиле RULER каждый скан соответствует точному декодированию топ-к, а на реальных сеансах кодирования Fathom достигает соглашения о стадии наиболее точного 136-битного скана при 92 битах. Магазин — это 4-битная копия K копирования квантизированной служебной стопки, и метод не быстрее, когда индекс является резидентом в памяти GPU. История представления: Vivek…