Administrator
Published on 2026-09-22 / 17 Visits
0
0

AI Agent 机构记忆需要来源绑定

可信的 Agent 机构记忆需要把每条可行动主张与来源、有效期、依赖关系和失效条件绑定。更大的上下文窗口能让模型一次看到更多文字,却无法判断哪条说法仍然有效,也无法在源文件更正后定位哪些决策需要重算。本文给出一套以来源绑定主张为核心的机构记忆设计。

阅读时间:约 8 分钟 · 约 2700 字

TL;DR

  • 记忆的最小单元应是带来源、时效、权限和依赖关系的主张,而不是无来源摘要。
  • 原始证据、主张库、检索索引和当前上下文承担不同职责,需要分层保存。
  • 检索只负责找候选信息。高影响动作还要验证主张状态和证据等级。
  • 源文件变化后,系统要沿依赖关系让派生主张失效,而不是静默覆盖旧值。
  • 机构记忆的验收指标应覆盖来源绑定率、过期率、冲突率和行动准确性。

V7 案例展示了 Context Graph 的价值边界

OpenAI 在 2026 年 9 月 21 日发布的 V7 案例介绍了一套 Context Graph。它连接实体、关系和带引用的证据。V7 Go 从企业资料库提取信息,把近期对话保留在模型当前上下文中,把更早的信息放进图中按需检索。V7 的产品页则把这套系统描述为连接基金报告、数据室、备忘录、邮件、实体关系和源证据的机构记忆。

这解决了一个真实问题:机构拥有多年的历史资料,Agent 每次执行任务时只能获得有限工作集。如果每次请求都重新搜索文件,成本会上升,埋在多份材料之间的关系也容易丢失。持久图谱可以保存这些关系,为后续任务提供可复用上下文。

关键边界在于,图中的一条边仍然只是一项主张。它可能已经过期,可能来自低权威来源,也可能在抽取或实体消歧时出错。图结构改善检索效率,来源和生命周期控制才决定检索结果是否值得信任。

这也与此前讨论的隐式工作区与外部记忆形成递进关系。前一篇解决模型计算与持久状态的边界。本文继续追问:持久状态必须保存哪些信息,后续 Agent 才能安全复用?

把主张而不是文档切片作为记忆单元

传统 RAG 往往保存文档切片及其向量。切片可以回答某段话在哪里。机构记忆还要回答:系统从这段话得到什么结论,这项结论适用于哪个时间和范围。

一个最小主张记录可以包含:

{
  "claim_id": "claim:fund-17:nav:2026-q2",
  "subject": "fund-17",
  "predicate": "reported_nav",
  "value": {"amount": 184000000, "currency": "USD"},
  "source_uri": "drive://reports/fund-17-q2-2026.pdf",
  "source_span": {"page": 12, "table": "Portfolio Summary"},
  "observed_at": "2026-07-19T09:14:00Z",
  "valid_from": "2026-06-30",
  "valid_to": null,
  "authority": "fund_manager_report",
  "derived_from": [],
  "status": "reviewed",
  "revalidate_on": ["source_changed", "newer_period_arrived"]
}

具体字段可以调整,但有六个不变量:

  1. 每项主张拥有稳定标识。
  2. 系统可以回到原始证据的具体页码或段落。
  3. 获取时间和业务有效时间分别记录。
  4. 派生主张显式列出上游依赖。
  5. 状态可以区分待审、已审、争议、已替代和失效。
  6. 重新验证拥有明确触发条件。

可验证系统的共同特征,是错误拥有可见的附着点。自由文本摘要会把问题藏在段落里。结构化主张让更正、审阅和依赖图都能指向同一个对象。

W3C 的 PROV-O 标准提供了 Entity、Activity 和 Agent 等通用溯源概念。Agent 记忆还要补充权威等级、有效期、冲突和行动风险,但仍应保持证据、转换过程与责任主体之间的分离。

分开保存证据、主张、索引和工作上下文

一个存储层同时承担四种职责,最终会让性能结构变成事实来源。更稳妥的架构是:

层级 用途 典型失败
原始证据 保存收到的文件或不可变快照 源文件消失或静默变化
主张库 表达有边界的事实和生命周期 无证据或已过期主张继续生效
检索索引 快速寻找相关证据和主张 排序漏掉决定性信息
工作上下文 给模型提供当前任务的精简视图 低信号材料挤占约束和证据

原始证据是审计基线。主张库是可复用的机构记忆。索引是可以重建和替换的性能结构。工作上下文只是当前决策的临时投影。

这种分层可以避免一个常见问题:Embedding 索引逐渐成为实际上的 Source of Truth。索引可能落后于删除、更正、权限变化和实体合并。重建索引可以改变检索效果,但不应改写权威证据和主张历史。

在可验证分析合同中也存在同样的边界。数据血缘负责把读者带到证据,验证负责检查转换和解释是否正确。路径完整只能说明错误可追溯,无法自动证明结论正确。

读取记忆和写入记忆需要两份合同

读取记忆的目标是在 Token 预算内找到相关信息。写入记忆会改变未来 Agent 可以相信什么。两者需要不同的控制条件。

读取时,返回一个有边界的子图,并至少包含:

  • 候选主张和当前状态;
  • 支撑它的原始证据位置;
  • 更新、更高权威或与之冲突的主张;
  • 该项信息命中当前任务的原因;
  • 允许当前主体读取它的权限规则。

写入时,至少要求:

  • 稳定来源或明确的观测事件;
  • 抽取方法、派生方法和版本;
  • 实体消歧置信度;
  • 与既有主张冲突时的处理规则;
  • 高影响字段的审阅人或自动验收测试;
  • 重新验证触发器。

Agent 对话可以先生成待审记忆。只有补齐证据和责任人后,它才适合晋升为已审主张。这样既能保留有价值的学习,又能防止模型生成的合理表述直接进入机构历史。

LLM Agent 的证据追踪与执行溯源研究从系统层描述了同一需求:文档、观测、记忆项、中间主张、动作和最终答案构成依赖网络。依赖网络支持选择性失效,也能回答某项证据是否影响了后续动作。

更正必须沿依赖关系传播

源文件改变后,派生摘要继续生效,是机构记忆最隐蔽的失败。来源链接支持人工检查,依赖链接才支持自动修复。

例如,一份季度报告更正了被投企业收入。系统应执行四步:

  1. 创建新的源文件快照,同时保留旧版本。
  2. 用明确原因把旧收入主张标记为已替代。
  3. 将依赖它的主张、备忘录和缓存回答标记为待复核。
  4. 只重算受影响的投影,并通知高影响动作的责任人。

旧主张不应被删除得像从未存在。历史决策可能在当时证据下完全合理。时间化历史既支持审计,也支持复盘。

冲突也要成为一等状态。两份有效来源可能因日期、会计口径或权威等级不同而出现矛盾。检索结果应暴露冲突。静默选择一个赢家,等于把数据质量问题藏进模型策略。

一份机构记忆上线门禁

在让 Agent 根据记忆采取行动之前,先跑通一条端到端主张链:

  1. 接入:原始来源能否冻结或版本化?
  2. 抽取:审阅者能否从主张跳到精确证据位置?
  3. 消歧:系统能否区分相似实体并解释合并?
  4. 冲突:矛盾来源能否产生可见的争议状态?
  5. 检索:上下文是否携带状态、来源和时效?
  6. 行动:影响越高,是否要求越强证据?
  7. 失效:来源更正能否触达所有依赖主张和产物?
  8. 审计:团队能否重建 Agent 当时知道什么?

至少跟踪四个指标:来源绑定覆盖率、过期主张率、未解决冲突率,以及由已审主张支撑的高影响动作比例。Recall 和延迟仍然有用,但它们衡量的是访问能力,而不是可信度。

可以从投资备忘录更新、客服政策问答或供应商风险审查等单一工作流开始。先在有限场景中验证生命周期规则,再扩大存储规模。否则系统只会得到更大的记忆和更大的静默错误面。

FAQ

Context Graph 等于 Agent 记忆吗?

Context Graph 可以承担 Agent 记忆的一部分,通过图结构连接实体、主张、关系和证据。生产系统还需要写入政策、有效期、冲突处理、权限、重新验证和审计。

更大的上下文窗口能替代长期记忆吗?

更大的窗口增加单次推理可见的材料。长期记忆负责跨任务和时间保存经过选择的状态。无论窗口多大,来源绑定和失效机制都仍然需要。

有溯源信息就能防止幻觉吗?

溯源让主张可以检查。验证还要确认抽取、解释、时效和当前决策的适用性。溯源是一条通往证据的路径,不是正确性证书。

是否应该保存每一段 Agent 对话?

原始日志可以按保留策略保存。机构记忆只晋升未来可复用且有证据支撑的主张。大规模日志和可信记忆承担不同任务。

两个来源冲突时怎么办?

保留双方主张,附上日期和权威等级,标记冲突,再应用领域规则。高影响冲突未解决前,应阻断自动行动。

先建立修复路径,再扩大记忆规模

机构记忆的目标,是让 Agent 继承组织判断,而不是囤积文本。来源绑定主张提供了合适的中间单元:足够小,可以验证;足够稳定,可以引用;拥有依赖关系,可以在证据变化后修复。

从现有工作流里选一项高影响主张,追踪它的来源、有效期、依赖和失效路径。任何仍靠口头约定维持的链路,就是下一项需要建设的记忆能力。

参考资料


Comment