Внимание: модели языка знают, когда вспомнить

#Внимание #Основываясь #Эксперименты #Qwen #Gemma

arXiv: 2609.20734v1 Тип объявления: новое резюме: разумная и агенственная рабочая нагрузка все чаще требует эффективного долгосрочного вывода. Тем не менее, полное оповещение о декодировании читает растущую историю на каждом шагу независимо от ее пользы для следующего предсказания. Мы показываем, что предварительно подготовленные данные о декодировании модели уже содержат информацию об этой выгоде до глобального чтения. Основываясь на этом выводе, мы введем метод " Внимание на месте &qt; (ODA) - местный первый метод декодирования с использованием легкой амортизирующей головки для выборочного привлечения глобального внимания к его прогнозируемым изменениям выгод в течение поколения. В рамках ОПР осуществляется подготовка только по команде отзыва, при этом предварительно подготовленные веса остаются неизменными и полный исторический кэш KV, который может быть использован в будущем. Мы далее внедряем условное исполнение на стороне GPU в vLM, преобразуя сокращенные глобальные записи в практическое декодирование быстрых операций над полным вниманием при длинных контекстах. Эксперименты по моделям Qwen и Gemma, включая гибридные позвонки, показывают t