AI Agent 记忆系统综述

原文:Memory for Autonomous LLM Agents: A Survey
发表:arXiv 2603.07670,2026 年 3 月
翻译整理:2026-06-16


为什么记忆系统如此重要

“有记忆与无记忆之间的差距,往往大于不同 LLM 骨干模型之间的差距。”

这是本综述最核心的结论。记忆系统不是锦上添花的功能,而是 Agent 能力的基础组件。

量化证据

  • 移除反思记忆后,原本能做多天连贯规划的 Agent(Generative Agents)在 48 小时内退化为重复性应答
  • 更换记忆系统后,任务完成率从 80% 跌至 45%(MemoryArena 基准)

核心框架:写-管-读循环

论文将 Agent 记忆系统形式化为 POMDP 结构中的写-管-读循环

Agent 接收输入
    ↓
[读取] 通过检索函数 ℛ 查询记忆
    ↓
Agent 基于记忆执行动作(策略 πθ)
    ↓
[写入] 通过管理函数 𝒰 更新记忆
    ↓
循环

关键洞察:这个循环是递归耦合的——写入质量决定了未来读取质量。错误的写入会污染下游所有决策,这是记忆系统最脆弱的地方。


三维分类体系

维度 1:时间维度(记忆类型)

记忆类型类比人类记忆存储内容典型实现
工作记忆当前注意力活跃的上下文窗口Token 上下文
情景记忆具体事件回忆带时间戳的具体经历向量数据库
语义记忆通用知识去情景化的抽象知识知识图谱、文本
程序记忆技能与习惯可复用的技能和执行计划代码库、技能库

维度 2:存储基底(用什么存)

类型特点优势劣势
上下文文本直接在 token 中透明、零延迟容量极其有限
向量索引存储嵌入向量 + 相似度检索可扩展丢失结构信息
结构化存储SQL 数据库、知识图谱精确查询需要结构化写入
可执行仓库代码库、已验证技能可直接运行维护成本高

维度 3:控制策略(谁来管理记忆)

策略描述适用场景
启发式控制固定规则(如超过 N 轮就压缩)简单、可预测场景
Prompt 自控LLM 自己调用工具管理记忆通用 Agent
学习型控制RL 优化记忆操作策略高性能要求场景

五大记忆机制详解

机制 1:上下文压缩(Context-Resident Compression)

方法:滑动窗口 + 滚动摘要,将超出窗口的内容压缩。

核心风险:“摘要漂移(Summarization Drift)“——在反复压缩的过程中,罕见但关键的细节会逐渐消失。

论文明确警告:单纯扩大上下文窗口无法解决这个问题,因为注意力稀释(Attentional Dilution)在超长上下文中同样会导致关键信息被忽视。

机制 2:检索增强存储(Retrieval-Augmented Stores)

方法:密集向量嵌入 + BM25 回退,构成两阶段检索。

当前标准实践Dense Embedding → BM25 Fallback → Reranker

核心挑战

  • 查询构建:Agent 需要知道「用什么词去搜」才能找到相关记忆
  • 有用性 vs 相似性:检索到的内容可能与查询相似,但对当前决策未必有用

机制 3:反思式自我改进(Reflective Self-Improvement)

代表:Reflexion 框架

方法:失败后存储语言反思文本,下次任务时注入上下文。

核心风险:“自我强化错误(Self-Reinforcing Error)“——Agent 对失败原因判断错误,错误反思被存入记忆后会被后续决策采纳,形成恶性循环,错误反思越积越多。

机制 4:层次化虚拟记忆(Hierarchical Virtual Memory)

代表:MemGPT

方法:主上下文 + 召回数据库 + 归档存储,OS 式分页管理。

核心风险:分页决策(该换出哪些信息)产生静默失败——换出了错误的内容没有任何错误信号,性能退化是不可见的,直到任务失败才被发现。

机制 5:策略学习型管理(Policy-Learned Management)

代表:AgeMem

方法:将存储、检索、更新、摘要、丢弃这五个操作作为 RL 优化的动作空间,训练最优记忆管理策略。

发现:RL 优化会发现人类直觉想不到的策略,如「预防性摘要」(在信息过期前主动摘要,而非等到空间不足时才处理)。

挑战:训练成本高,可解释性差。


三种架构模式与选型建议

模式架构特点选型建议
Pattern A纯上下文简单,容量受限简单任务,快速原型
Pattern B上下文 + 检索存储生产主力,平衡性能与复杂度大多数生产场景
Pattern C分层记忆 + 学习控制能力最强,工程最复杂有充分数据证明需要时才用

论文推荐

“从 Pattern B 开始,充分监控,只有当实证数据表明学习型控制能显著改善结果时,才升级到 Pattern C。“


评估基准现状

传统信息检索指标(precision@k、nDCG)不适用于 Agent 记忆评估,因为它们忽略了检索到的信息是否真正影响了决策。

近年出现的新基准:

基准关注点关键发现
LoCoMo(2024)35 场景对话记忆人类在时序动态上远超 Agent
MemBench(2025)事实 vs 反思记忆两种能力是独立的,不互相转化
MemoryAgentBench(2025)四种认知能力没有系统掌握「选择性遗忘」
MemoryArena(2026)多会话 Agent 任务LoCoMo 优秀的系统在这里下降 40-60%

关键发现

“长上下文不等于记忆。即使有 200k token 的上下文窗口,当需要选择性召回和主动管理时,检索增强系统优于纯长上下文模型。“


工程实践要点

写入路径(Write Path)

必须做的工程投入:

  • 过滤:不是所有信息都值得写入
  • 规范化(Canonicalization):避免同一信息以不同表述存入多次
  • 去重:建立内容哈希或相似度检测
  • 优先级评分:高重要性信息优先保留

风险分析视角:将失败模式(如遗漏过敏记录)映射到后果,指导过滤阈值设置——医疗场景要求近乎完美的忠实度,推荐场景可以容忍更高错误率。

读取路径(Read Path)

两阶段检索:快速 BM25 → 慢速重排序(Reranker)

其他优化:

  • 检索门控(Retrieval Gating):判断当前步骤是否真的需要检索,避免无效检索
  • Token 预算控制:限制每次检索注入的 token 数
  • 高频内容缓存:常被检索的记忆直接缓存到上下文

时效性与矛盾处理

长期运行的 Agent 必须解决:

  • 时间版本控制:同一信息的不同时间版本如何管理
  • 来源归因:每条记忆来自哪里,可信度如何
  • 矛盾检测:当新信息与旧记忆矛盾时如何处理
  • 定期整合:周期性地将碎片化记忆整合成更高层次的语义记忆

十大开放挑战

  1. 原则性整合:如何在不知道未来需求的情况下,决定保留什么、丢弃什么?
  2. 因果检索:按因果关系检索,而非仅按相似度
  3. 可信反思:如何防止自我强化错误?(验证 + 反思文本过期机制)
  4. 学会遗忘:在安全和合规约束下的选择性遗忘
  5. 多模态记忆:跨模态检索(文本/图像/音频)
  6. 多 Agent 治理:多 Agent 共享记忆的访问控制和共识机制
  7. 记忆高效架构:稀疏检索、压缩表示
  8. 神经科学整合:激活扩散、记忆再巩固理论的工程化
  9. 通用记忆基础模型:跨任务的通用记忆控制
  10. 标准化评估:统一的社区排行榜和指标体系

应用场景与记忆类型对应

应用场景最关键的记忆类型
个人助理语义记忆(用户偏好、个人档案)
代码 Agent程序记忆(已验证的代码模式、架构决策)
游戏 Agent情景记忆 + 程序记忆的紧密整合
科学推理带显式不确定性的语义记忆
多 Agent 系统协调层记忆(目前支持最不完善)