FastE: Зачитывание токенов с перезагрузкой для вскрытия LLM

#FastE #Зачитывание #Annualce #Type #Embed

arXiv: 260090.8407v1 Annualce Type: новый резюме: В этом исследовании мы идентифицируем наличие избыточного префикса в модели окончательного чтения LLM, особенно через репрезентативные позвонки, включая Qwen3-Embed and Qwent3-VL-Embendding. Мы считаем, что удаление префиксовых состояний значительно более вредно в мелком слое, чем на большей глубине, показав, что преференционные состояния становятся все больше сжатыми по мере распространения префиксных и считывающих государств через сеть. С этой целью мы введем метод FastE, неподготовленный и безудержный. FastE использует общий фиксированный порог для считывания данных из партии в качестве легкого онлайнового эвристического параметра при выборе момента сжатия, а также рейтинги префиксов состояния по баллам внимания, которые они получают от положения считываемого времени, чтобы определить, какие состояния сохраняются в последующих слоях. Наши оценки показывают способность FastE существенно снизить вычислительные расходы: на NarractQA с Qwen3-Embending-0.6B, это уменьшает декодер-бэкбон FLO

Компьютерная наука > Искусственный интеллект [представлен 8 сентября 2026 года] Название: FastE: Preadout-Triggered Token Compication for LLM Embending Inference View PDF HTML (экспериментальный) Резюме: В этом исследовании мы идентифицируем наличие избыточного префикса, находящегося в зависимости от глубины, в модели окончательного чтения LLW, особенно через репрезентативные позвонки, включая Qwent3-Embedding и Qwen3-VL-Embeding. Мы считаем, что удаление префиксовых состояний значительно более вредно в мелком слое, чем на большей глубине, показав, что преференционные состояния становятся все больше сжатыми по мере распространения префиксных и считывающих государств через сеть. С этой целью мы введем метод FastE, неподготовленный и безудержный. FastE использует общий фиксированный порог для считывания данных из партии в качестве легкого онлайнового эвристического параметра при выборе момента сжатия, а также рейтинги префиксов состояния по баллам внимания, которые они получают от положения считываемого времени, чтобы определить, какие состояния сохраняются в последующих слоях. Наши оценки показывают способность " FastE &qt; существенно снизить вычислительные расходы: на NarrativeQA с Qwen3-Embedding-0.6B она сокращает декодер-бэкбоны FLOP на 40,11% при сохранении 99,53% полного переднего nDCG@10. В рамках пяти текстовых контрольных показателей, двух базовых шкал и трех межмодальных задач по поиску информации можно непосредственно адаптировать компромисс на основе…