可信的 Agent 机构记忆需要把每条可行动主张与来源、有效期、依赖关系和失效条件绑定。更大的上下文窗口能让模型一次看到更多文字,却无法判断哪条说法仍然有效,也无法在源文件更正后定位哪些决策需要重算。本文给出一套以来源绑定主张为核心的机构记忆设计。
阅读时间:约 8 分钟 · 约 2700 字
TL;DR
- 记忆的最小单元应是带来源、时效、权限和依赖关系的主张,而不是无来源摘要。
- 原始证据、主张库、检索索引和当前上下文承担不同职责,需要分层保存。
- 检索只负责找候选信息。高影响动作还要验证主张状态和证据等级。
- 源文件变化后,系统要沿依赖关系让派生主张失效,而不是静默覆盖旧值。
- 机构记忆的验收指标应覆盖来源绑定率、过期率、冲突率和行动准确性。
V7 案例展示了 Context Graph 的价值边界
OpenAI 在 2026 年 9 月 21 日发布的 V7 案例介绍了一套 Context Graph。它连接实体、关系和带引用的证据。V7 Go 从企业资料库提取信息,把近期对话保留在模型当前上下文中,把更早的信息放进图中按需检索。V7 的产品页则把这套系统描述为连接基金报告、数据室、备忘录、邮件、实体关系和源证据的机构记忆。
这解决了一个真实问题:机构拥有多年的历史资料,Agent 每次执行任务时只能获得有限工作集。如果每次请求都重新搜索文件,成本会上升,埋在多份材料之间的关系也容易丢失。持久图谱可以保存这些关系,为后续任务提供可复用上下文。
关键边界在于,图中的一条边仍然只是一项主张。它可能已经过期,可能来自低权威来源,也可能在抽取或实体消歧时出错。图结构改善检索效率,来源和生命周期控制才决定检索结果是否值得信任。
这也与此前讨论的隐式工作区与外部记忆形成递进关系。前一篇解决模型计算与持久状态的边界。本文继续追问:持久状态必须保存哪些信息,后续 Agent 才能安全复用?
把主张而不是文档切片作为记忆单元
传统 RAG 往往保存文档切片及其向量。切片可以回答某段话在哪里。机构记忆还要回答:系统从这段话得到什么结论,这项结论适用于哪个时间和范围。
一个最小主张记录可以包含:
{
"claim_id": "claim:fund-17:nav:2026-q2",
"subject": "fund-17",
"predicate": "reported_nav",
"value": {"amount": 184000000, "currency": "USD"},
"source_uri": "drive://reports/fund-17-q2-2026.pdf",
"source_span": {"page": 12, "table": "Portfolio Summary"},
"observed_at": "2026-07-19T09:14:00Z",
"valid_from": "2026-06-30",
"valid_to": null,
"authority": "fund_manager_report",
"derived_from": [],
"status": "reviewed",
"revalidate_on": ["source_changed", "newer_period_arrived"]
}
具体字段可以调整,但有六个不变量:
- 每项主张拥有稳定标识。
- 系统可以回到原始证据的具体页码或段落。
- 获取时间和业务有效时间分别记录。
- 派生主张显式列出上游依赖。
- 状态可以区分待审、已审、争议、已替代和失效。
- 重新验证拥有明确触发条件。
可验证系统的共同特征,是错误拥有可见的附着点。自由文本摘要会把问题藏在段落里。结构化主张让更正、审阅和依赖图都能指向同一个对象。
W3C 的 PROV-O 标准提供了 Entity、Activity 和 Agent 等通用溯源概念。Agent 记忆还要补充权威等级、有效期、冲突和行动风险,但仍应保持证据、转换过程与责任主体之间的分离。
分开保存证据、主张、索引和工作上下文
一个存储层同时承担四种职责,最终会让性能结构变成事实来源。更稳妥的架构是:
| 层级 | 用途 | 典型失败 |
|---|---|---|
| 原始证据 | 保存收到的文件或不可变快照 | 源文件消失或静默变化 |
| 主张库 | 表达有边界的事实和生命周期 | 无证据或已过期主张继续生效 |
| 检索索引 | 快速寻找相关证据和主张 | 排序漏掉决定性信息 |
| 工作上下文 | 给模型提供当前任务的精简视图 | 低信号材料挤占约束和证据 |
原始证据是审计基线。主张库是可复用的机构记忆。索引是可以重建和替换的性能结构。工作上下文只是当前决策的临时投影。
这种分层可以避免一个常见问题:Embedding 索引逐渐成为实际上的 Source of Truth。索引可能落后于删除、更正、权限变化和实体合并。重建索引可以改变检索效果,但不应改写权威证据和主张历史。
在可验证分析合同中也存在同样的边界。数据血缘负责把读者带到证据,验证负责检查转换和解释是否正确。路径完整只能说明错误可追溯,无法自动证明结论正确。
读取记忆和写入记忆需要两份合同
读取记忆的目标是在 Token 预算内找到相关信息。写入记忆会改变未来 Agent 可以相信什么。两者需要不同的控制条件。
读取时,返回一个有边界的子图,并至少包含:
- 候选主张和当前状态;
- 支撑它的原始证据位置;
- 更新、更高权威或与之冲突的主张;
- 该项信息命中当前任务的原因;
- 允许当前主体读取它的权限规则。
写入时,至少要求:
- 稳定来源或明确的观测事件;
- 抽取方法、派生方法和版本;
- 实体消歧置信度;
- 与既有主张冲突时的处理规则;
- 高影响字段的审阅人或自动验收测试;
- 重新验证触发器。
Agent 对话可以先生成待审记忆。只有补齐证据和责任人后,它才适合晋升为已审主张。这样既能保留有价值的学习,又能防止模型生成的合理表述直接进入机构历史。
LLM Agent 的证据追踪与执行溯源研究从系统层描述了同一需求:文档、观测、记忆项、中间主张、动作和最终答案构成依赖网络。依赖网络支持选择性失效,也能回答某项证据是否影响了后续动作。
更正必须沿依赖关系传播
源文件改变后,派生摘要继续生效,是机构记忆最隐蔽的失败。来源链接支持人工检查,依赖链接才支持自动修复。
例如,一份季度报告更正了被投企业收入。系统应执行四步:
- 创建新的源文件快照,同时保留旧版本。
- 用明确原因把旧收入主张标记为已替代。
- 将依赖它的主张、备忘录和缓存回答标记为待复核。
- 只重算受影响的投影,并通知高影响动作的责任人。
旧主张不应被删除得像从未存在。历史决策可能在当时证据下完全合理。时间化历史既支持审计,也支持复盘。
冲突也要成为一等状态。两份有效来源可能因日期、会计口径或权威等级不同而出现矛盾。检索结果应暴露冲突。静默选择一个赢家,等于把数据质量问题藏进模型策略。
一份机构记忆上线门禁
在让 Agent 根据记忆采取行动之前,先跑通一条端到端主张链:
- 接入:原始来源能否冻结或版本化?
- 抽取:审阅者能否从主张跳到精确证据位置?
- 消歧:系统能否区分相似实体并解释合并?
- 冲突:矛盾来源能否产生可见的争议状态?
- 检索:上下文是否携带状态、来源和时效?
- 行动:影响越高,是否要求越强证据?
- 失效:来源更正能否触达所有依赖主张和产物?
- 审计:团队能否重建 Agent 当时知道什么?
至少跟踪四个指标:来源绑定覆盖率、过期主张率、未解决冲突率,以及由已审主张支撑的高影响动作比例。Recall 和延迟仍然有用,但它们衡量的是访问能力,而不是可信度。
可以从投资备忘录更新、客服政策问答或供应商风险审查等单一工作流开始。先在有限场景中验证生命周期规则,再扩大存储规模。否则系统只会得到更大的记忆和更大的静默错误面。
FAQ
Context Graph 等于 Agent 记忆吗?
Context Graph 可以承担 Agent 记忆的一部分,通过图结构连接实体、主张、关系和证据。生产系统还需要写入政策、有效期、冲突处理、权限、重新验证和审计。
更大的上下文窗口能替代长期记忆吗?
更大的窗口增加单次推理可见的材料。长期记忆负责跨任务和时间保存经过选择的状态。无论窗口多大,来源绑定和失效机制都仍然需要。
有溯源信息就能防止幻觉吗?
溯源让主张可以检查。验证还要确认抽取、解释、时效和当前决策的适用性。溯源是一条通往证据的路径,不是正确性证书。
是否应该保存每一段 Agent 对话?
原始日志可以按保留策略保存。机构记忆只晋升未来可复用且有证据支撑的主张。大规模日志和可信记忆承担不同任务。
两个来源冲突时怎么办?
保留双方主张,附上日期和权威等级,标记冲突,再应用领域规则。高影响冲突未解决前,应阻断自动行动。
先建立修复路径,再扩大记忆规模
机构记忆的目标,是让 Agent 继承组织判断,而不是囤积文本。来源绑定主张提供了合适的中间单元:足够小,可以验证;足够稳定,可以引用;拥有依赖关系,可以在证据变化后修复。
从现有工作流里选一项高影响主张,追踪它的来源、有效期、依赖和失效路径。任何仍靠口头约定维持的链路,就是下一项需要建设的记忆能力。