Компьютерные науки > Вычисление и язык [представлен 7 октября 2026 года] Название: " Реальная долгосрочная память для AI: 50-миллиардное окно, которое быстрее и дешевле, чем просмотр PDF HTML (экспериментальное) резюме: Большая языковая модель может использовать только текст, который подходит в его окне контекста, и она перенасыщает свое внутреннее значение ключа (KV) на каждый раз при направлении сигнала. Мы проверяем слой памяти, открытый пакет Galahad-kv, который сохраняет состояние KV в каждом блоке примерно 16 000 символов для зашифрования местного диска NVM и загружает его позже, байт-точно, без перезагрузки. Мы прогнали его на 50 000 тысяч символов реального публичного текста, послужив с помощью VLM на одной NVIDIA H100, с Джемма 4 12B и Gemma 4 31B. Все блоки, которые мы обследовали были загружены из зашифрованного магазина без перезагрузки (100 из 100 на глубинах от 0 до 50 м символов) обеих моделей. Загрузка блока была 2,8x - 4.3х быстрее, чем перезагрузка и использовала 8.8x на 12.3x меньше энергии GPU, а память ГПУ оставалась плоской по всему потоку с 50 м. На вопрос о фактах, положенных миллионами символов ранее, модель 12B дала правильный ответ 82 раза из 100 и 31В модель 98 раз из 100. Ни одна модель не придумала ответа. Пределы являются следующими. Это повторное использование хранимого состояния, а не более широкое окно внимания: один блок загружается в одно время, и насколько хорошо ответ на вопрос зависит от модели. Писать память - это разовая цена, и…
Реальная долгосрочная память для AI: 50 миллионов-тонное окно, которое быстрее и дешевле чем перезагрузка
arXiv: 261 010.10845v 1 Annualce Type: New Humber Abstract: Большая языковая модель может использовать только текст, который вписывается в ее контекстное окно, и она пересчитывает свое внутреннее значение ключа (KV) для каждого момента отправки. Мы проверяем слой памяти, открытый пакет Galahad-kv, который сохраняет состояние KV в каждом блоке примерно 16 000 символов для зашифрования местного диска NVM и загружает его позже, байт-точно, без перезагрузки. Мы прогнали его на 50 000 тысяч символов реального публичного текста, послужив с помощью VLM на одной NVIDIA H100, с Джемма 4 12B и Gemma 4 31B. Все блоки, которые мы обследовали были загружены из зашифрованного магазина без перезагрузки (100 из 100 на глубинах от 0 до 50 м символов) обеих моделей. Загрузка блока была 2,8x - 4.3х быстрее, чем перезагрузка и использовала 8.8x на 12.3x меньше энергии GPU, а память ГПУ оставалась плоской по всему потоку с 50 м. На вопрос о фактах, положенных миллионами символов ранее, модель 12B дала правильный ответ 82 раза из 100 и 31В модели 98 раз из 98