Реклама

Память как контролируемый процесс: усвоение адаптивного управления памятью для агентов LLM

#Память #Annuales #Type #MemCon #Маркова

arXiv: 2607.13591v2 Annuales Type: заменить резюме: агенты большой языковой модели (LLM) все больше полагаются на внешние системы памяти для накопления опыта в различных задачах. Тем не менее, почти все существующие подходы: от графически структурированных воспоминаний до рефлексирующих магазинов знаний, доступ к памяти через фиксированную эвристику вручную. Мы утверждаем, что этот статический взгляд на память является основным препятствием для агенского обучения, потому что оптимальное поведение памяти в корне зависит от контекста. На ранних этапах выполнения задач можно получить минимально необходимую информацию из-за ограниченности памяти; регулярно повторяющиеся типы целей получают пользу от повторного использования планов, а не от обычного поиска ближайших соседей; застрявшие агенты выигрывают в результате повторных запросов с альтернативными запросами; и для сохранения полезности в рамках длинных потоков задач сам магазин памяти должен быть консолидирован и урезан. Мы представляем Память как контролируемый процесс (MemCon) — систему, которая моделирует операции памяти в качестве процесса решения Маркова и учится онлайн-политике, которая адаптивно решает когда,