Зачем вообще нужен KV cache?
Сегодня вы узнаете об одном из самых важных понятий в современном ИИ — о KV cache. С помощью него происходит оптимизация трансформера.
Мы знаем, что сегодняшние большие языковые модели опираются на архитектуру transformer, а самое важное понятие в трансформере — механизм attention(он же механизм внимания). Кратко напомним: attention помогает уловить смысл слова, учитывая все окружающие слова. Это делается через attention-вычисления.
Модели генерации текста вроде Chat GPT тоже основаны на архитектуре трансформера, но используют только decoder-часть. Они генерируют текст авторегрессивно — проще говоря, по одному токену за раз.