Administrator
Published on 2026-09-25 / 15 Visits
0
0

法律 AI 需要事项级证据合同

法律 AI 正在从回答问题进入真实事项:检索判例、读取客户材料、生成 S-1 草稿、按律师偏好组织备忘录。此时最重要的问题已经从能否生成,变成能否证明每条主张依据什么、谁核过、哪个版本获批、出错后如何收回。Astra for Law、Cooley GO Public 与 Harvey 展示了能力栈,事项级证据合同负责补上责任闭环。

阅读时间 9 分钟 · 约 3200 字

核心结论

  • Astra for Law 在 200 道私有验证题上的 overall correctness check 通过率为 54.0%,普通 Web 搜索基线为 38.7%。这是 15.3 个百分点的绝对提升,仍有 46% 未通过。
  • 三个案例分别覆盖法律权威检索、受控流程和事项上下文起草,尚未公开一条从授权到交付、再到纠错关闭的完整审计轨迹。
  • 事项级证据合同应把每条重要主张连接到具体来源段落、权威状态、复核决定和唯一批准版本。
  • 引证只是验证入口。律师和机构继续承担判断、批准与交付责任。
  • 复核强度应随任务风险变化,低风险转换可抽样,高风险对外交付需要独立核验和明确签署。

证据核验日期:2026 年 9 月 25 日。本文分开表述厂商披露、外部基准、职业伦理指导与工程化建议,不构成法律意见。

先把 54% 说清楚

OpenAI 将 Astra for Law定义为一套完整配置:GPT-6 Astra、法律搜索索引、专用指令、工具和设置。索引覆盖美国判例、成文法、法规、法院规则和行政决定,语料超过 2.3 亿 URL。

OpenAI 使用 Vals AI Legal Research Bench 的 200 道私有验证题做了对比。在双方都使用最高 reasoning effort 时,完整配置的 overall correctness check 通过率为 54.0%,GPT-6 Astra 加普通 Web 搜索为 38.7%。绝对差是 15.3 个百分点,相对提升约 39.5%。

这个结果能证明专业索引和法律工作流优于普通搜索基线。它无法证明系统已经达到无人监督可用,也不能外推到合同审查、IPO 申报或客户建议。54.0% 同时意味着 46% 没有通过该项检查。

另外两个数字属于检索指标:

  • 在判例类问题中,Astra for Law 找到的 reference cases 多 24%。
  • 在经审计的目标段落子集中,它从正确判决里检出的相关段落最高多 54%。

第二个最高 54% 是特定子集的段落检索增益,与 54.0% 的正确性通过率含义不同。

Vals 的基准说明显示,完整数据集共 413 题,其中 Public 5 题、Private Validation 200 题、Test 208 题。公开榜单使用 Test set,OpenAI 使用 Private Validation,两个分数不能直接排名。公开材料还缺少私有运行的置信区间、运行次数、成本、延迟和完整配置。

这正是审计轨迹的意义:一个分数只有连着数据集、版本、评审器、时间和失败规则,才是一条可复核证据。

三个案例组成了一套能力栈

把三个案例拆开看,容易得到三篇产品新闻。把它们叠在一起,可以看见法律 AI 系统的三个层次。

第一层:找到法律权威

Astra for Law 负责搜索公共法律材料,并给律师返回可检查的权威来源。OpenAI 称其接入的 CourtListener 集合覆盖超过 99.9% 的美国已发布先例判例。

Free Law Project 的覆盖说明给出了准确边界:99.9% 修饰的是已发布的美国先例判例,不包含全部未发表意见、docket 文件、合同、客户事实和商业数据库。语料覆盖率也无法直接证明判例仍然有效、法域匹配、具体段落支持某条主张。

第二层:编排受控流程

Cooley GO Public把客户资料、公共来源和精选先例组合成 IPO 起点。Agentic harness 明确哪些步骤可以自动执行,哪些位置必须由律师复核或验证。

Cooley 自己的发布稿说,律师参与法律分析和最终工作成果。发布稿还称 Form S-1 初稿可以从数天缩短为数分钟,但没有公开样本量、基线、返工量和最终 filing 周期。这是一项客户方能力声明,尚未成为独立效果证据。

第三层:使用事项上下文起草

Harvey 的案例把法院信息、律所文件、判例研究和其他事项材料放进起草流程。Memory panel 还允许律师设置来源和格式偏好,例如优先使用 EDGAR。

页面只给出了格式和上下文感知改善的定性描述,没有公开任务集、对照模型、绝对指标、逐主张引证核验率或强制批准路径。更多上下文可以形成更好的草稿,也可以形成更有说服力的错误。差别取决于系统是否保留主张、来源与复核决定之间的关系。

三个案例共同证明了组件已经出现。公开证据仍不足以证明端到端责任闭环已经完成。

事项级证据合同包含七个模块

事项级证据合同是一份版本化记录。它规定 AI 可以使用什么、生成了什么、证据在哪里、谁做了复核,以及满足什么条件才可以离开事项文件。

模块 最小记录 能暴露的失败
事项与授权 matter_id、法域、目标、允许任务、禁止动作、客户指令、责任律师 Agent 越过委托范围或客户要求
输入与权限 材料清单、快照或哈希、敏感级别、所有者、伦理墙、批准工具和保留模式 跨事项泄露、输入过期、数据被未授权复用
主张到来源 claim_id、具体段落、正式引证、权威层级、法域、核验日期、支持或冲突状态 引证真实却不支持命题,或遗漏不利权威
运行溯源 模型、搜索索引、插件、工作流与提示版本,运行时间和工件标识 模型或索引变化后无法重现结果
复核决定 复核人、范围、方法、例外、修订、批准或退回、时间 系统声称有人审过,却没有可检查证据
发布与交付 唯一批准版本、文件哈希、收件人、渠道、时间和必要披露 草稿被误当成提交版或客户交付版
纠错与关闭 影响面、遏制、通知、修正版、重新核验、根因、关闭与重开条件 修了局部错误,却没有追踪下游影响

这份合同无需公开特权材料,也不要求保存或披露模型思维链。它需要为有权复核的人保留稳定的证据引用。

最小状态机可以压缩为:

已接入 -> 已生成 -> 已核验 -> 已批准 -> 已交付
                  |          |
                  +-> 已退回 +-> 重大变化后重开

每次状态迁移都需要证据。链接到一个来源,只能让主张进入待核验,不能直接进入已批准。

复核门禁跟着风险走

ABA Formal Opinion 512提供了重要基线:律师应理解工具能力与限制,保护客户信息,监督内部人员与外部服务,向法院提交前核查分析与引证,并继续对客户工作承担责任。

该意见没有为所有任务规定同一种复核方式。合理强度取决于工具、任务、既往验证和风险。这可以转化为三级门禁:

任务类型 建议门禁
格式调整、分类、内部路由 自动检查加有记录的抽样
研究备忘录、合同草稿 逐主张来源检查、法域与权威状态核验、指定复核人
法院文件、客户建议、证券披露、外部承诺 重要主张完整独立核验、责任律师明确批准、冻结交付版本

所有低风险处理都做全文人工复核,会吃掉自动化收益。把抽样策略直接用于法院文件,则会把效率转成未管理风险。

NIST 生成式 AI 风险管理配置文件可以补充执行字段:系统清单、来源与版本、人工监督角色、第三方控制、事故响应、回退和变更历史。它是跨行业自愿建议,作用是把责任要求转换为工程控制,而不是创造新的律师义务。

应该测复核系统,而不只测模型

证据合同建立后,律所才能测量真正产出法律工作的完整流程:

  • 主张可追溯率:重要主张中,有多少连到具体来源段落。
  • 权威核验率:有多少完成法域、效力、日期和命题支持检查。
  • 不利权威覆盖:必须处理的冲突是否已发现、解决或明确保留。
  • 复核产出率:人工复核修改、退回或升级了多少内容。
  • 变更传播完整性:事实、交易条款或权威变化后,受影响章节是否全部重开。
  • 交付完整性:实际交付物是否等于批准版本,必要披露是否完成。
  • 纠错时延:从发现错误到遏制、通知、重新核验和关闭用了多久。

这里有一个值得监控的反常信号:复核从不改变任何内容,可能说明模型很稳定,也可能说明复核只是盖章。复核产出、例外质量和下游纠错能帮助区分两者。

这也是本文与通用企业 AI 治理框架的边界。组织级政策回答谁管理 AI 风险,事项级合同回答某一份法律交付物是否已经获得放行资格。

常见问题

Astra for Law 是什么?

它是 OpenAI 基于 GPT-6 Astra 的法律专用配置,包含法律搜索索引、专用指令、工具和控制。截至 2026 年 9 月 25 日,它通过早期访问向部分美国律所开放,API 尚未正式推出。

54% 是否说明 Astra for Law 已经可靠?

它说明完整系统在指定设置下,通过了 200 道私有验证题中 54.0% 的 overall correctness check。它不代表生产错误率,也不覆盖客户结果、合同起草、法院提交和无人监督使用。

为什么不能和 Vals 公开榜单比较?

OpenAI 使用 200 道 Private Validation 题,Vals 公开榜单使用另一组 208 道 Test 题。数据分割不同,系统配置也可能不同,直接排名会混淆口径。

法律 AI 审计轨迹至少记录什么?

至少记录事项授权、来源与权限、主张到段落的映射、权威状态、模型与工具版本、复核决定、唯一批准版本、纠错动作和关闭条件。

AI 生成的引证应该怎样核验?

核验需要确认来源存在、仍然有效、法域正确、具体段落支持当前命题、事实适配,并检查是否遗漏控制性的不利权威。实际范围取决于任务和适用规则。

法律搜索索引能否替代律师复核?

搜索索引可以改善发现与段落检索。它无法承担专业责任,也无法替律师决定客户目标、事实适配、战略判断和文件是否可交付。

下一步

先选一条真实事项流程接入证据合同,再扩大自动化范围。第一版只需要三道门:每条重要主张连到具体段落,每份对外交付物有明确批准人,每次重大变化都会重开受影响主张。

完成这三步,法律 AI 才会从流畅的起草组件,变成一套可以被检查、质疑、纠正和负责交付的系统。

参考资料


Comment