Реклама

Преобразование КВ-каша в количественный и линейный набор внимания: от теории к предварительной миграции веса

#Преобразование #КВ-каша #Аннонс #КВ-каче #KV-кач

arXiv:2610.11214v1 Аннонс Тип: новое резюме: КВ-каче квантизация и линейное внимание являются двумя репрезентативными подходами к решению проблем, связанных с хранением и расчетными расходами трансформеров. KV-кач квантизация сжимает отдельные записи KV в дискретные коды, но сохраняет все позиции, тогда как линейное внимание периодически агрегирует множественные исторические вклады KV на фиксированный размер непрерывное состояние, однако может создавать помехи. В связи с этим контрастом возникает вопрос о том, можно ли в рамках единого механизма для эффективного внимания преодолеть компрессию на единицу КВ и агрегацию с использованием нескольких единиц КВ. Мы идентифицируем RAM-Net как такой мост через мягкие задания по дискретному адресному пространству. Эти задания определяют регулярное обновление данных в режиме постоянной записи, связанных с каждым адресом. При ограниченной конструкции RAM-Net мы доказываем, что мягкие адресные задания длиннее жесткой квантизированной совпадающей с разделимым написанием совпадения, которое на местном уровне приблизительно соответствует полному восприятию и переплетается