Administrator
Published on 2026-09-03 / 11 Visits
0
0

组织第二大脑如何向专家学习,同时避免固化专家错误

组织第二大脑可以把少数专家的判断能力分发给整个组织,也可能把某位专家的一次错误判断固化为默认答案,再由搜索和 Agent 反复放大。决定结果的核心是一套知识控制系统:来源可追溯、适用范围明确、变更可比较、错误可重放、旧知识可退役。

Meta 最新公开的工程案例给出了一条较完整的实现路径。它把组织知识与推理流程分开,把专家纠正编译成可审阅的文本改动,再经过定向重放、回归测试和专家批准后落地。这个案例最值得复用的原则是:组织学习的最小单元应是一份通过验证的知识变更,而非一次文档上传或一个点赞。

这套知识维护层位于AI 原生组织的运行结构之下,也补充了隐式工作区与外部 Agent 记忆之间的时间边界。前者讨论组织怎样重构,后者讨论状态怎样跨调用保存,本文聚焦共享领域知识如何获得和失去权威。

Meta 的组织第二大脑比普通 RAG 多了什么

Meta 为一个专业合规领域构建了 AI Agent,系统由四个相互依赖的部分组成:结构化知识库、可组合的推理 recipe、评测框架和自我改进闭环。

知识库包含 200 多个文件。Position 文件表达组织对某类问题的正式解释;taxonomy 和 vocabulary 文件统一术语;routing index 根据输入特征选择知识与流程;gateway 文件先判断问题是否满足进入某个分析领域的门槛。每个文件还在 YAML frontmatter 中声明 depends_onreferenced_by,由此形成双向依赖图。

高密度、高频使用的组织立场进入经过整理的 wiki。体量大、使用频率低、只有特定场景才相关的原始资料继续留在语义或关键词检索层。这个划分解决了一个常被 RAG 掩盖的问题:原始资料与组织判断具有不同的生命周期。产品说明书可以作为来源保存;组织如何解释并应用其中一条规则,则需要责任人、适用范围、版本和审核记录。

Meta 还把知识与方法拆成两个控制面。知识文件负责说明组织知道什么、认可什么;recipe 负责说明分析时先看什么、按什么顺序判断、何时算完成。官方报告称,分阶段加载相关 recipe 后,每轮 Token 消耗降低约 80%。更重要的收益是故障归因:错误来自知识缺口、分析流程缺陷,还是事实本身存在歧义,可以分别处理。

Meta 工程原文是一手架构证据。效果数字需要收窄解读。Meta 自述经过三轮 sprint、六周开发后,单次评估耗时从数天缩短到数分钟,改进周期内实现零回归;原文没有公开测试集规模、通过阈值、Judge 一致率、成本和独立复现。因此,零回归表示现有测试集没有发现退化,无法代表系统覆盖未知错误。

最大风险是权威漂白

很多知识系统会把以下六种状态压成一个已验证标签:

  1. 来源文档出现过某句话。
  2. AI 从文档中提取出一条候选规则。
  3. 一位专家在某个场景中同意这条规则。
  4. 有权限的负责人批准它成为组织立场。
  5. 这条规则在已知任务上改善了结果。
  6. 当前政策与业务条件下,这条规则仍然有效。

这六种状态的证据强度不同。把它们混在一起,专家身份会替内容完成权威背书。系统一旦只保留结论,丢掉提出者、证据、适用范围和有效期,一次局部经验就可能升级成全局规则。

Provenance 的作用是保留这条演化链。MIT Press 的一篇同行评议综述把 provenance 扩展到数据、模型、算法、验证结果和工作流,并强调谁在何时做了什么。它同时划清边界:来源记录可以帮助调查原因,不能自动证明内容正确。W3C PROV-O提供了派生、归因、修订和失效等关系语义;组织仍需自行定义谁有审批权、何时允许发布。

用状态机管理知识,而非堆积页面

一条组织知识至少应经历六个状态:

状态 含义 使用边界
原始证据 政策、决策记录、访谈、事故或外部资料 供引用与重新分析
机器候选 AI 提取的摘要、规则、关系或修改建议 只进入审核
专家反馈 修订意见、反例、例外或争议判断 供归因与测试设计
已批准知识 责任人在明确范围内批准的版本 可进入正常检索与推理
使用结果 某次回答或动作使用了哪个知识版本,以及结果如何 供评测与事故分析
已退役知识 已被替代或确认失效的历史版本 只供审计,默认退出检索

Open Knowledge Format v0.2 规范说明纯文本可以成为可靠底座。OKF 使用 Markdown 与 YAML frontmatter,并提供可选的 provenance、trust 和 lifecycle 字段。Google 将其定位为人和 Agent 都能读取、可 diff、可迁移的格式,而非新的检索平台。格式降低了审阅与版本控制成本,审批和评测仍需额外设计。

下面是一份最小知识对象示例:

id: procurement.vendor-data-residency
status: approved
owner: team:security-governance
applies_when:
  region: eu
  data_class: restricted
sources:
  - id: policy-2026-17
    resource: policies/2026-17.md
derived_from_version: 4
verified_by: human:domain-owner
verified_at: 2026-09-03T01:30:00Z
valid_from: 2026-09-10T00:00:00Z
stale_after: 2027-03-10T00:00:00Z
supersedes: procurement.vendor-data-residency@3
tests:
  - eval/procurement/eu-restricted-017

这些字段属于本文的工程建议,并非现成行业标准。它们需要回答五个可执行问题:知识从哪里来,谁对它负责,何时适用,哪些测试保护它,失效后由什么替代。

专家反馈先是一条事件

点赞、点踩或一句纠正只产生信号。信号经过归因、修复、验证、批准和发布后,才形成完整的学习闭环。Glean 的用户反馈文档对此给出了清晰边界:标记 helpful 或 not helpful 本身不会直接改善回答,也不会触发自动重训。一次点踩可能来自问题含糊、来源质量不足、检索上下文错误等不同原因。

Meta 的根因判定方法值得直接借鉴。系统先从对话轨迹中提取实质反馈,同时读取 Agent 当时加载过哪些文件、何时加载、怎样使用。随后检查现有资料是否足以推出正确答案:

  • 资料包含正确答案,Agent 仍然出错:修复推理 procedure。
  • 资料缺少正确答案:补充知识层。
  • 合格专家对正确答案存在分歧:进入人工讨论与仲裁。

生产系统还应补两类原因。第一类是检索失败,正确文件存在,但没有进入本次上下文。第二类是权限失败,Agent 取用了当前用户无权使用的内容。不同根因需要不同改动,也需要不同验收器。

把每次纠正编译为受控变更

可靠的反馈闭环可以写成一条流水线:

反馈事件 → 根因归因 → 最小 diff → 影响分析 → 原场景重放 → 回归测试 → 专家批准 → 受控发布

类似原则也适用于操作知识。此前对 Agent Skill 的证据审计显示,紧凑流程的价值来自稳定动作和暴露验收信号。领域事实、推理 procedure 与确定性检查应分别放在合适的控制面上。

其中有三道关键门禁。

第一关:确定性结构检查

Linter 可以检查断链、重复 ID、责任人缺失、日期非法、依赖环、文件超限,以及已退役知识仍被活动索引引用。结构检查无法证明语义正确,但可以低成本清除一整类工程错误。

第二关:原场景定向重放

冻结触发本次反馈的问题、检索上下文、权限、关键配置和评分规则,然后重跑原案例。Meta 使用盲测设计:被测 Agent 不知道自己正在处理历史失败,独立 Judge 也看不到本次修改的理由,以降低确认偏差。

第三关:回归集与新鲜度集

固定一份基准集,用于跨版本比较;另设高风险、争议项、低频长尾和最新政策切片。只持续向一个回归集加入旧失败,系统会越来越擅长处理昨天的问题,同时忽略今天的分布变化。数据集、Rubric、Judge 模型、Agent 配置和知识快照需要一起版本化。

ServiceNow 的官方 NLU 流程覆盖了部分生命周期:团队可以比较训练后的草稿与线上模型,保留测试历史,并把真实专家反馈样例加入默认测试集。C3 AI 的 Agent Evaluation 文档也把 Dataset 定义为版本化测试集合,让每次实验绑定明确的数据版本。这些机制解决可复现性;Meta 案例进一步把根因归因、最小知识改动、盲重放、回归测试和专家审批接成了一条维护流水线。

为专家分歧和知识退役预留出口

专家分歧本身就是领域证据。它可能暴露适用范围缺失、风险偏好不同、政策模糊或真实不确定性。系统应保留双方观点、证据和适用条件,再交给明确的责任人或治理机制裁决。简单多数票容易把常见错误升级为正式政策。

每条已批准知识也需要退出路径。退役与删除承担不同职责:退役版本继续留在审计链中,正常检索默认排除。记录至少应包含失效时间、失效原因、替代版本、批准人和下游消费者。

真正困难的是影响传播。某条政策更新后,系统需要定位哪些历史回答、决策规则、评测样例和自动化动作使用过旧版本。高影响变更还应触发重新评测或人工复核。因此,依赖图不只是导航工具,也是组织执行知识召回的控制面。

从一个可验证领域开始

首个试点应选择问题反复出现、专家时间稀缺、结果可以核验的窄领域。合规审查、安全规范、采购评估和工程标准比全公司知识问答更适合起步。

  1. 收集 20 至 50 个真实高频案例,同时保留失败、例外和歧义样例。
  2. 冻结原始来源,明确哪些角色可以批准组织立场。
  3. 把高频整理知识与低频检索资料分层。
  4. 将推理 procedure 与领域事实分别维护。
  5. 先运行影子模式,用同一批案例比较 Agent 与专家结论。
  6. 每个确认失败同时产出最小修复和回归用例。
  7. 设置新鲜度复核与退役触发器,再扩展到下一个领域。

衡量系统时,答案采纳率只是一项信号。更有用的指标包括单次评估消耗的专家时间、首轮有用率、重复纠正率、过期引用率、升级准确率、高风险回归数、反馈到批准修复的周期,以及已退役知识仍出现在活动答案中的比例。

目标是让专家投入形成可控复利。每次纠正都应沉淀为可审阅的改进,同时保持可质疑、可逆和有证据可查。

常见问题

组织第二大脑与个人第二大脑有什么区别?

个人第二大脑主要优化个人的信息捕获、整理和调用。组织系统还要处理权威、权限、适用范围、专家冲突、审计、评测和退役,因为它的输出会影响其他员工与自动化流程。

为什么有可搜索文档库还不够?

搜索负责找证据。组织对证据的正式解释、应用方法和变更保护机制需要分别维护,才能区分来源事实、组织立场与执行流程。

专家反馈应该立即更新知识库吗?

反馈可以立即进入事件队列。它通过根因归因、来源核验、定向重放、回归测试和责任人批准后,再晋升为活动知识。

多位专家意见冲突时听谁的?

先保留每个观点的证据与适用范围,再路由给具有明确权限的责任人或治理机制。最终结果可能是按场景拆分规则,而非强行形成一个统一答案。

这套架构需要微调模型吗?

Meta 的方案通过更新结构化知识与推理 recipe 完成改进,无需重训底层模型。文本变更更容易审核、比较和回滚;微调可以服务其他目标,但它会降低知识变化的可见性。

哪些内容应该继续放在 RAG 中?

高密度、高频使用的组织立场和 procedure 适合进入整理后的知识文件。大体量、低频、情境相关的原始资料继续由语义或关键词检索提供,同时保留来源身份与版本信息。

零回归意味着什么?

它表示某次运行中,定义好的测试集没有检测到覆盖范围内的退化。结论强度取决于用例覆盖、阈值、数据新鲜度、Judge 质量和配置控制。

参考资料


Comment