Agent 系统中的短期记忆与长期记忆:架构、存储与检索深度分析
Agent 系统中的短期记忆与长期记忆:架构、存储与检索深度分析
调研时间:2026 年 7 月 | 时间范围:2025–2026 | 来源数量:23 篇(含 10 篇学术论文)
执行摘要
在 LLM Agent 系统中,「记忆」已从早期简单的对话历史堆叠,演进为一等公民级别的架构组件。2025–2026 年间的研究表明:记忆架构的优劣对 Agent 智能的上限影响,往往超过 LLM 骨干模型本身的差异。短期记忆(STM)与长期记忆(LTM)的分野,是理解当前 Agent 记忆体系的核心轴线——但最新的学术进展正在超越这一二元框架,向多维、多层的精细化分类演进。
本文从 STM/LTM 的定义与本质区别出发,深入对比两者在存储策略、检索机制、工程实现上的差异,并追踪前沿框架(MemGPT/Letta、Mem0、A-MEM、DPM)的设计哲学与适用边界。核心发现包括:「全塞进上下文」与「激进检索」的二选一争论已被 Memora(ICML 2026)的调和表示方案证伪——98% 的上下文 Token 缩减而不损失性能;记忆自治性谱系(从 A-MEM 的完全自治到 DPM 的完全确定性)揭示了「谁来管理记忆」这一更深层的设计抉择;而安全性(记忆投毒、越权检索)与评估盲区(隐式约束满足)则是当前实践中的关键短板。
1. 短期记忆(Short-Term Memory):上下文窗口中的瞬态高带宽存储
1.1 定义与本质
在 LLM Agent 系统中,短期记忆直接映射到模型的上下文窗口(Context Window)。它是瞬态的(会话结束即消亡)、高带宽的(完整注意力可及)、容量受限的(受限于 Token 上限)。与人类的「工作记忆」类比,STM 承载着 Agent 当前任务的全部在线状态——对话轮次、工具调用结果、任务进展、中间推理步骤。
Du (2026) 在其综合综述中形式化地将 STM 纳入 Write-Manage-Read 循环:写入(哪些信息进入上下文)、管理(如何压缩与淘汰)、读取(模型如何利用上下文中的信息)。这一形式化揭示了一个常被忽视的事实——STM 的核心瓶颈不是「存不下」,而是「用不好」。
1.2 核心挑战:注意力稀释
STM 面临的首要挑战并非简单的容量不够,而是注意力稀释(Attention Dilution)。Liu et al. (2023) 在「Lost in the Middle」研究中确立了U 形注意力曲线:模型对上下文开头和结尾的内容注意力集中,对中间位置的内容则显著衰减。这一发现在 DeepMind 的 Gemini 2.5 Agent 实验中得到印证——上下文超过约 100K Token 后,Agent 开始反复重复历史动作而非生成新策略,实际上被自身的历史上下文「劫持」 (HOS, 2026)。
Elasticsearch 团队对 Agentic 记忆的分析进一步总结了上下文管理不善的五类失败模式 (Someshwaran Mohankumar / Elastic, 2025):
| 失败模式 | 描述 |
|---|---|
| 上下文投毒 (Context Poisoning) | 虚假信息在上下文中持续存在并被反复引用 |
| 上下文分心 (Context Distraction) | 模型过度依赖上下文而忽略自身训练知识 |
| 上下文混淆 (Context Confusion) | 无关信息降低输出质量 |
| 上下文冲突 (Context Clash) | 矛盾信息导致不一致输出 |
| 上下文泄漏 (Context Leakage) | 多租户场景中跨用户数据暴露 |
1.3 存储策略
STM 的存储策略以速度优先为核心特征:
| 存储方式 | 访问延迟 | 持久性 | 典型场景 |
|---|---|---|---|
| 进程内内存(Python dict/状态对象) | < 1ms | 进程生命周期 | 原型验证、单次推理 |
| Redis(结构化 KV + TTL) | < 1ms | 可配置(TTL 过期) | 生产级会话状态 |
| 内存快照/检查点 | 1–10ms(序列化/反序列化) | 显式持久化到磁盘 | 任务切换、错误恢复 |
腾讯云开发者文章描述了一种结构化 WorkingContext 对象作为核心数据结构,包含文件引用、对话轮次、任务状态、光标位置和操作流——本质上是 Agent 工作环境的完整快照 (HOS, 2026)。LangGraph 的 MemorySaver 检查点机制即采用此模式,在每个图节点捕获完整 Agent 状态以支持回滚与恢复。
遗忘策略是 STM 管理中的关键工程决策。遗忘并非被动的信息丢失,而是主动的信息淘汰。实践中的做法是按重要性分级(Critical / High / Medium / Low / Trivial),结合访问频率(对数衰减)、时间衰减和衰减因子进行综合评分 (HOS, 2026)。LangChain 提供的 ConversationBufferWindowMemory(滑动窗口保留最近 k 轮)和 ConversationSummaryMemory(LLM 生成摘要压缩旧轮次)即为此类策略的具体实现。
1.4 检索策略
STM 的「检索」本质上就是注意力机制——模型在推理时对上下文中所有 Token 的加权聚合。因此优化 STM 检索的核心在于上下文工程(Context Engineering):
Andrej Karpathy 于 2025 年中期正式提出了上下文工程范式,将整个上下文窗口视为必须被主动管理的稀缺资源。四层上下文架构被识别为:系统层(固定指令与人设)、检索层(RAG 获取的上下文)、工具输出层(工具调用结果)、隐式层(模型参数化知识)。四种核心压缩策略包括:
- 裁剪 (Trimming):移除旧消息
- 摘要 (Summarization):LLM 生成的历史压缩
- 结构化笔记 (Structured Note-taking):提取关键事实为紧凑表示
- 子 Agent 委托 (Sub-agent Delegation):将子任务卸载到拥有独立上下文的 Agent
2. 长期记忆(Long-Term Memory):跨会话的持久化知识体系
2.1 定义与本质
长期记忆是 Agent 跨会话持久化的经验知识库,支撑用户偏好、项目知识、习得模式的持续积累。与 STM 的根本区别在于:STM 始终存在于上下文中,而 LTM 必须被显式检索才能被 Agent 感知。这意味着 LTM 的设计不仅关乎「存什么」,更关乎「何时取」和「如何取」。
2.2 存储策略:三层存储谱系
LTM 的存储已形成从向量数据库、图数据库到参数化编码的三层谱系:
第一层:向量数据库(语义存储)
| 数据库 | 特点 | 适用场景 |
|---|---|---|
| Pinecone | 全托管,低延迟,高成本 | 企业级生产,快速上线 |
| Milvus | 开源,可私有部署,功能全 | 数据主权要求高的场景 |
| Qdrant | Rust 实现,高性能,支持过滤 | 低延迟高吞吐场景 |
| ChromaDB | 轻量级,Python 原生 | 原型验证、小规模部署 |
| Weaviate | 原生混合搜索(BM25 + 向量) | 需要关键词+语义双路召回 |
| Elasticsearch | 成熟生态,kNN + BM25,可配 rank_window | 企业级混合检索 |
向量存储的核心流程是:文本 → 分块 (Chunking) → 嵌入 (Embedding, 如 text-embedding-3-small, BGE, E5) → 向量索引 → 近邻搜索 (ANN)。
第二层:图数据库(结构存储)
Neo4j 等图数据库承载实体-关系知识图谱,存储架构决策记录、项目文档、代码依赖关系等可遍历的结构化知识。图存储捕获的是向量存储无法表达的关联维度——「这个函数被那个模块调用,而那个模块依赖这个库」的链式推理路径。
第三层:参数化编码(模型内化)
Du (2026) 的分类法中的参数记忆(Parametric Memory)指向一种更激进的存储策略:将知识编码进模型权重本身(通过微调/训练)。这是最「永久」的记忆形式,但操作成本最高,灵活性最低。Srinivasan (2026) 提出的确定性投影记忆 (DPM) 则介于向量存储与参数编码之间——使用仅追加事件日志加任务条件投影,在决策时刻生成确定性的上下文片段,实现 20 倍压缩率下 +0.52 事实精度提升,且仅需 1 次 LLM 调用(对比摘要法的 83–97 次)。
2.3 检索策略:从单路到混合的演进
LTM 检索已从简单的 Top-k 相似度搜索演进为多信号混合架构:
▼text复制代码查询 → [BM25 关键词匹配] ─┐ ├→ 倒数排名融合 (RRF) → 交叉编码器重排 → 最终结果 [稠密向量 ANN 搜索] ─┘
典型四步流水线:
- BM25 关键词匹配:精确词法召回,捕获专有名词、术语、代码标识符
- 稠密向量相似度搜索(ANN):语义相关性,捕获同义转述、概念关联
- 倒数排名融合 (RRF):合并两路结果集,平衡词法精度与语义广度
- 交叉编码器重排(如 Provence, 仅 1.75GB):对候选段落逐个评分,精细化排序
Elasticsearch 的 Agentic 记忆实现给出了具体的工程方案:LangGraph 检查点摘要被索引到 Elasticsearch,通过 kNN 搜索检索,可配置 rank_window(候选池大小)和 k(最终返回数量) (Someshwaran Mohankumar / Elastic, 2025)。
图检索作为第三维度,补充了关键词和向量搜索都无法覆盖的关系遍历能力。三路混合(关键词 + 向量 + 图遍历)代表了当前 LTM 检索的最前沿实践。
3. STM 与 LTM 的核心区别对照
| 维度 | 短期记忆 (STM) | 长期记忆 (LTM) |
|---|---|---|
| 本质 | 上下文窗口中的 Token | 外部持久化存储中的嵌入/结构 |
| 生命周期 | 会话级,进程结束即消亡 | 跨会话,显式删除才消亡 |
| 访问方式 | 注意力机制(隐式,全量可及) | 显式检索(主动查询) |
| 容量约束 | 128K–1M Token(硬上限) | 理论无限(受存储成本约束) |
| 访问延迟 | < 1ms(推理时自动可用) | 10–500ms(取决于存储后端) |
| 可靠性 | 受注意力稀释影响(U 形曲线) | 受检索质量影响(召回率/精度) |
| 核心风险 | 信息过载、上下文混淆 | 检索缺口、记忆投毒 |
| 写入策略 | 追加式(对话轮次),主动淘汰 | 提取式(关键信息),去重合并 |
| 典型存储 | 进程内存、Redis | 向量数据库、图数据库 |
| 对应人类认知 | 工作记忆 | 情景记忆 + 语义记忆 |
4. 超越二元:多维记忆分类法的演进
传统的 STM/LTM 二分法在过去两年经历了三轮重要的理论拓展:
4.1 四层认知模型(Futurum Research, 2025)
| 层次 | 名称 | 描述 | 存储方式 |
|---|---|---|---|
| 1 | 工作记忆 (Working) | 当前活跃上下文 | 上下文窗口 |
| 2 | 情景记忆 (Episodic) | 具体经历,带时间戳 | 向量数据库 |
| 3 | 语义记忆 (Semantic) | 抽象事实与规则 | 知识图谱 + 向量数据库 |
| 4 | 程序记忆 (Procedural) | 习得技能与行为模式 | 参数化编码 / 工具定义 |
4.2 三维分类法(Du, 2026)
Du 在综合综述中提出三维分类:时间范围(瞬态 / 中期 / 永久)× 表示基底(Token / 参数 / 潜在表示)× 控制策略(启发式 / 学习式 / 自治式)。这一框架超越了 STM/LTM 的简单时间划分,引入了编码模态和管理自治度两个关键维度。
4.3 Token / 参数 / 潜在分类(NUS + 人民大学 + 复旦 + 北大联合综述, 2025)
- Token 记忆:上下文窗口中的内容(对应 STM)
- 参数记忆:编码在模型权重中的知识(最永久的 LTM)
- 潜在记忆:中间激活、缓存计算、压缩表示——不归属于 STM 或 LTM 的中间态
这一分类暗示着STM 与 LTM 的边界正在模糊化。Memora (ICML 2026) 的调和表示方案即是明证:在上下文中始终维持一份压缩的「骨架」记忆(STM 中的 LTM 压缩体),并按需检索详细信息(LTM 中的高保真原始记忆),实现 98% 的上下文 Token 缩减而不损失性能 (Xia et al., 2026)。
5. 框架谱系:谁在管理记忆?
当前主流 Agent 记忆框架可按自治性谱系排列:
▼text复制代码高自治 ◄──────────────────────────────────────────────► 高确定性 │ │ A-MEM MemGPT/Letta Mem0 AgeMem DPM (完全自治) (OS 隐喻) (解耦层) (RL 学习) (确定性投影) Zettelkasten LLM 自管理 半自治 RL 梯度优化 无状态 原则驱动 内存分页 提取+去重 统一 STM/LTM 可审计
| 框架 | STM/LTM 边界管理 | 核心创新 | 量化指标 |
|---|---|---|---|
| MemGPT/Letta | LLM 自主决定何时从上下文「换页」到持久存储 | 虚拟上下文管理,OS 隐喻 | ~19K GitHub Stars |
| Mem0 | 解耦层管理,LLM 提议但基础设施强制一致性 | 记忆即独立基础设施,Mamba-3 编码器 (v2.0) | 47K+ Stars, +4.8% over Mem0 baseline |
| A-MEM (NeurIPS 2025) | Agent 完全自主组织、链接、演化记忆网络 | Zettelkasten 原则,笔记间自动关联 | - |
| AgeMem (Yu, 2026) | RL 学习统一的存储/检索/更新/淘汰策略 | 三阶段渐进 RL (GRPO) | +49.59% vs 无记忆, +4.8% vs Mem0 |
| DPM (Srinivasan, 2026) | 固定投影参数,系统设计决定边界 | 无状态确定性,仅追加事件日志 | +0.52 精度 @20x 压缩, 1 次 LLM 调用 |
关键洞察:高自治系统(A-MEM、MemGPT)的 STM/LTM 边界由模型动态管理;确定性系统(DPM)的边界由系统设计固定;半自治系统(Mem0)介于两者之间。自治度越高,适应性越强但可审计性越弱;确定性越高,合规性越好但灵活性受限。
6. 「全塞 vs 激进检索」之争的调和
这是 2024–2025 年间 Agent 记忆领域最具争议的话题。两极立场分别主张:
- 全塞进上下文:利用 1M+ Token 的长上下文窗口,将所有相关信息直接放入上下文
- 激进检索:仅保留最小上下文,按需从外部存储检索
2025 年前的实证结果确实「暧昧」——效果随任务类型、检索质量、模型架构而摇摆。但 2026 年 ICML 论文 Memora 提供了突破性证据:两种极端都不对,调和表示方案最优 (Xia et al., 2026)。
Memora 的核心思路是解耦存储与检索:存储保持丰富、具体的高保真记忆;检索使用轻量级抽象和线索锚点。标准 RAG 和知识图谱方案被证明是这一调和框架的特例。在 LoCoMo 和 LongMemEval 基准上,Memora 以最多 98% 更少的上下文 Token 达到了新的 SOTA。
从工程视角理解这一调和:
- 全塞的风险 = 注意力稀释 + 成本爆炸(每多 1K Token 都增加推理时间和费用)
- 激进检索的风险 = 检索脆弱性(漏取关键上下文、取到错误条目)
- 调和方案 = 始终维持一份压缩的持久上下文骨架 + 按需检索补充细节
Microsoft 和 Salesforce 的联合研究也佐证了这一结论:多轮对话中积累的上下文实际上比单次查询包含所有相关信息的效果更差——早期错误中间答案持续存在于上下文中并造成混淆 (Someshwaran Mohankumar / Elastic, 2025)。「Less is More」函数调用研究进一步表明,8B 参数的 Llama 模型在 46 个工具时失败,19 个时成功——上下文混淆是硬约束,即使上下文窗口未满。
7. 工程选型指南:何时用 STM,何时用 LTM?
7.1 适用 STM 的场景
- 单次会话内的多轮对话
- 当前任务的进度追踪与状态管理
- 工具调用的即时结果缓存
- 临时推理链与中间步骤
推荐存储:Redis(生产级)或进程内状态(原型级)
推荐淘汰策略:滑动窗口 + 摘要压缩 + 重要性评分
7.2 适用 LTM 的场景
- 用户长期偏好与习惯
- 项目领域知识
- 历史交互经验与教训
- 实体关系与架构知识
推荐存储:
| 规模 | 向量数据库 | 图数据库 |
|---|---|---|
| 原型/小规模 | ChromaDB | - |
| 中等规模 | Qdrant / Weaviate | - |
| 企业生产 | Pinecone / Milvus / Elasticsearch | Neo4j |
| 需要混合搜索 | Weaviate / Elasticsearch | Neo4j |
推荐检索策略:BM25 + 稠密向量 + RRF 融合 + 交叉编码器重排;关系密集场景增加图遍历
7.3 OpenClaw 的 Markdown 优先方案
OpenClaw(前身为 Clawdbot、Moltbot)提供了一种独特的本地优先方案:纯 Markdown 文件即记忆真相来源。其两层记忆结构为:
memory/YYYY-MM-DD.md:仅追加的每日日志(对应情景记忆)memory/kb/:手工策展的知识文档(对应语义记忆)
默认记忆插件 memory-core 实现混合检索(向量相似度 + 关键词匹配)。用户可直接用文本编辑器检查和修改 Agent 的记忆。这一方案牺牲了专用向量数据库的性能,但换来了简洁性、透明性和人类可编辑性——适合个人/小团队使用,但在需要集中管理、多用户访问控制、弹性伸缩的企业场景中受限 (CSDN, 2026a, 2026b)。
8. 安全性:被忽视的关键维度
Lin et al. (2026) 提出的记忆生命周期框架揭示了 STM 与 LTM 在安全属性上的根本差异:STM(上下文内)是瞬态的,会话间自动重置;LTM(持久存储)则创造了持久的攻击向量——投毒的向量嵌入、图注入、检索操纵都直指 LTM。
六阶段威胁模型覆盖了记忆的完整生命周期:写入 (Write) → 存储 (Store) → 检索 (Retrieve) → 执行 (Execute) → 传播 (Share & Propagate) → 遗忘与回滚 (Forget & Rollback)。中心概念「记忆主权」(Mnemonic Sovereignty)主张 Agent 对自身记忆操作应具有可验证的控制权。
这直接映射到自治性谱系:高自治系统(A-MEM、MemGPT)因模型自管理决策的不透明性,需要更强的记忆主权保障;确定性系统(DPM)天然更可审计但牺牲了适应性。安全性不应是后期附加,而应是每个架构决策的一等考量维度。
9. 评估盲区:当前基准的不足
现有评估基准(LoCoMo、LongMemEval、MemBench)主要聚焦显式事实召回——「你记住了用户的名字吗?」。Li et al. (2026) 提出的 LoCoMo-Plus 揭示了一个关键盲区:隐式约束满足——Agent 是否能在不被显式提醒的情况下,尊重用户的沟通风格偏好、隐含目标和价值观?
这一盲区对 STM/LTM 的交互尤为重要:隐式约束常驻于 LTM(积累的交互模式和用户偏好),但须在 STM(即时响应生成)中被满足。一个在显式召回上表现优异的系统,可能在隐式约束上彻底失败——而当前没有基准能检测到这种失败。
10. 未来方向
-
STM/LTM 边界的消融:Memora 的调和表示和 AgeMem 的统一管理策略指向同一趋势——STM 与 LTM 的严格分野将逐步消融,代之以编码保真度的连续谱。
-
内生状态压缩(Phase 3):模型在其隐藏状态中固有地压缩和保持信息,无需外部存储。这是 2026 年后的核心研究方向。
-
Mamba/SSM 架构在记忆编码中的应用:线性时间序列建模范式可能替代 Transformer 注意力作为记忆子系统的更优编码器(Mem0 2.0 已做工程验证,学术验证待跟进)。
-
确定性投影记忆的企业级落地:DPM 的无状态 + 可审计 + 可重演特性,使其在金融、医疗等合规场景中具有独特价值。
-
记忆安全的体系化治理:从「事后修补」转向「设计内置」,VMG 框架的五项架构原语(可验证、可监控、可治理)将成为企业采纳的前提条件。
参考文献
学术论文 (A 级)
- Du, P. (2026). "Memory for Autonomous LLM Agents: Mechanisms, Evaluation, and Emerging Frontiers." arXiv:2603.07670. https://arxiv.org/abs/2603.07670
- Lin, Z. et al. (2026). "A Survey on the Security of Long-Term Memory in LLM Agents." arXiv:2604.16548. https://arxiv.org/abs/2604.16548
- Yu, Y. et al. (2026). "Agentic Memory: Learning Unified Long-Term and Short-Term Memory Management for LLM Agents." arXiv:2601.01885. https://arxiv.org/abs/2601.01885
- Xu, W. et al. (2025). "A-MEM: Agentic Memory for LLM Agents." NeurIPS 2025. arXiv:2502.12110. https://arxiv.org/abs/2502.12110
- Xia, M. et al. (2026). "Memora: A Harmonic Memory Representation Balancing Abstraction and Specificity." ICML 2026. arXiv:2602.03315. https://arxiv.org/abs/2602.03315
- Li, Y. et al. (2026). "Locomo-Plus: Beyond-Factual Cognitive Memory Evaluation Framework." arXiv:2602.10715. https://arxiv.org/abs/2602.10715
- Srinivasan, V. (2026). "Stateless Decision Memory for Enterprise AI Agents." arXiv:2604.20158. https://arxiv.org/abs/2604.20158
- Liu, N. F. et al. (2023). "Lost in the Middle: How Language Models Use Long Contexts." arXiv:2307.03172. https://arxiv.org/abs/2307.03172
- Sumers, T. et al. (2023). "Cognitive Architectures for Language Agents." arXiv:2309.02427. https://arxiv.org/abs/2309.02427
- NUS, 人民大学, 复旦, 北大, 同济 (联合). (2025). "Memory in the Age of AI Agents: A Survey." arXiv:2512.13564. https://arxiv.org/abs/2512.13564
行业报告与技术文章 (B 级)
- HOS (安全风信子). (2026-05-24). "Memory System: 短期、长期与永久记忆体系." 腾讯云开发者社区. https://cloud.tencent.com/developer/article/2674638
- Someshwaran Mohankumar / Elastic. (2025-12-30). "使用 Elasticsearch 管理 Agentic 记忆." Elastic Search Labs Blog. https://www.elastic.co/search-labs/blog/agentic-memory-management-elasticsearch
- CSDN / a13662080711. (2026-06-01). "AI Agent 记忆系统架构深度解析: 从 MemGPT 到 Mem0 的三大学派." https://blog.csdn.net/a13662080711/article/details/161564266
- 知乎 / Agent Memory 技术趋势. (2026-04-21). "Agent Memory 技术趋势总结 (2025-2026)." https://zhuanlan.zhihu.com/p/2029957153943999095
- 知乎 / AI Agent 记忆系统. (2026-06-16). "AI Agent 记忆系统工程: 四层架构、Mem0/Zep/Letta/LangMem 生产选型." https://zhuanlan.zhihu.com/p/2050287092194973690
- CSDN / huhu2k. (2026-02-20). "OpenClaw 架构深度拆解: 工程优雅的本地优先 AI Agent." https://blog.csdn.net/huhu2k/article/details/158156422
- CSDN / summerliyang. (2026-06-13). "OpenClaw Agent 微架构全景深入分析." https://blog.csdn.net/summerliyang/article/details/161937829
- CSDN / xyghehehehe. (2026-06-30). "Mamba架构在Agent记忆系统中的崛起: Mem0 2.0 与长程上下文管理新范式." https://blog.csdn.net/xyghehehehe/article/details/162463778
- 百度云 / 深入浅出LangChain. (2025-11-24). "AI Agent记忆存储与多轮对话实战指南." https://cloud.baidu.com/article/5253607
- 极客公园. (2025-12-01). "2025 AI 记忆系统大横评." https://www.geekpark.net/news/357474
- CSDN / qkh1234567. (2025-12-25). "Agent Memory深度解析: 与RAG、上下文关联的技术全揭秘." https://blog.csdn.net/qkh1234567/article/details/156238639
开源项目与产品文档 (C 级)
- Chhikara, P. et al. (2025). "Mem0: Building Production-Ready AI Agents with Scalable Long-Term Memory." arXiv:2504.19413. https://arxiv.org/abs/2504.19413
- Letta (MemGPT). GitHub Repository. https://github.com/letta-ai/letta
