昊梵体育网

[CL]《Memory as a Controlled Process: Lea

[CL]《Memory as a Controlled Process: Learned Adaptive Memory Management for LLM Agents》E H Jiang, Z Zhang, Y Wu, L Li… [University of California Los Angeles] (2026)

在 LLM 智能体领域,如何跨任务积累并调用经验是一个悬而未决的难题。过去的方法受困于静态的硬编码启发式规则(如固定检索 top-k 或单一检索模板),本质原因是忽略了内存操作的高度上下文相关性:任务初期检索会稀释提示词,而陷入僵局时则需要改变检索策略,固定的“一刀切”配置导致了效率与精度的双重流失。

本文的核心洞见是:把内存访问重新看作一个马尔可夫决策过程(MDP),并引入轻量级的在线强化学习进行动态控制。由此,MEMCON 这一框架使智能体能像人类一样自主决定“何时检索、检索什么、检索多少”以及“何时遗忘”,通过上下文多臂老虎机(UCB)在不增加额外 LLM 调用成本的前提下,实现了从盲目检索到按需调度的认知跳跃。

这项工作真正留下的遗产是证明了“内存管理能力”可以从存储后端中解耦,成为一种可学习的元认知策略。它为后来者打开的新门是通往“插件式”的自适应内存控制层,显著提升了复杂任务成功率并降低了 Token 消耗,但尚未跨过的门槛是如何在极度异构的任务流中实现更深层的跨域知识迁移,以及处理超大规模内存池时的实时调度压力。

arxiv.org/abs/2607.13591 机器学习 人工智能 论文 AI创造营