Реклама

Спарсе-декодирование: Дешифрование-показатель для точного и эффективного вывода LLM

#Спарсе-декодирование #Дешифрование-показатель #Annuate #Type #Humber

arXiv: 2610.123227v1 Annuate Type: New Humber Brieflow: Природа, связанная с памятью на этапе декодирования большой языковой модели (LLM) вывод имеет значительную запоздалость. Одним из важных решений этой проблемы являются основанные на использовании Гессианского подхода к использованию бессистемной сети, поскольку стирание позволяет сократить количество ненулевых параметров, которые зачитываются в памяти во время декодирования. Тем не менее, типичные методы в этой строке вычисляют Гессен с использованием предварительно собранных естественных последовательностей, тогда как модель подается самовыпущенным символам во время декодирования, создавая сдвиг распределения между этими двумя последовательностями. Гессиан, рассчитанный по естественной последовательности отличается от того, что рассчитывается на генерируемой последовательность. Мы отмечаем, что это несоответствие приводит к отходу в распределении активации во время жизни поколения от того, которое используется для обрезки серфинга, еще больше ухудшая эффективность модели. Кроме того, большинство существующих методов серфинга LLM, которые приводят к фактической ускорению, в первую очередь нацелены на маленькую матричную матрицу (SpMM) мультипликацию