MentalHealthBench 把心理健康 AI 评测从少量危机 Prompt 推进到 1,215 段现实感更强的合成对话,并由持证专家为每个案例定制 Rubric。它仍是一套诊断工具,而非部署安全证书。高风险评测需要风险分层合同:严重伤害、漏升级、过度升级、空响应和弱势子组分别过门,任何一项都不能被平均分抵消。
阅读时间:约 10 分钟 · 约 3800 字
TL;DR
- MentalHealthBench 包含 1,215 段合成对话和 5,262 条专家标准,超过 80 位持证专业人员参与,每组最终 Rubric 至少经过三位临床专家处理。
- 数据覆盖普通困扰、高风险和紧急情况,也覆盖成人、青少年、临床人员和照护者,明显超越只测危机的基准。
- 论文主总分是 Task-clipped Score:每个回答的负分会先截断为零再平均。论文同时提供惩罚和行为轴分解,风险分析必须保留这些信息。
- 每题生成 4 个回答并取平均,Rubric 由 GPT-5.6 Sol 判断。部署验收还应报告尾部失败,并由独立临床人员复核高影响判断。
- 语言与长期上下文覆盖不均。数据中只有 1 段中文对话,只有 70 题包含实质性历史上下文,无法据总体分数推出所有语言和长期交互均安全。
- 部署门禁要联合检查能力、安全、子组、运行闭环和上线后证据。一次伤害性指导不能由高同理心得分抵消。
MentalHealthBench 带来了什么
OpenAI 的 MentalHealthBench 论文解决了早期心理健康评测的两个缺口:覆盖范围集中在危机,以及只给安全或不安全标签。
公开数据集包含 1,215 段合成对话前缀和 5,262 条 Rubric:
- 53.5% 为非急性情况,18.2% 为高风险,28.3% 为紧急情况;
- 用户画像中成人占 68.1%,青少年占 21.2%,临床人员占 5.8%,照护者占 4.9%;
- 53.7% 的对话前缀超过 5 条消息;
- 主题覆盖亲密关系、自伤与自杀、信念系统、精神病性体验、用药不确定性、创伤、饮食与身体形象、成瘾和伤害他人等。
超过 80 位持证心理学家和精神科医生参与,来自 20 多个国家。每段对话先由两位专家独立写标准,再由第三位专家裁决。最终标准采用 -10 到 10 的带符号权重,并分配到十个行为轴,包括上下文询问、临床准确性、同理心、现实检验、紧急度校准、伤害规避和用户自主性。
这个设计很重要。一个回答可以语气温暖,却漏掉紧急危险;也可以对所有普通困扰都推荐急诊,表现得谨慎却制造过度升级;还可以避免直接伤害,却顺着用户的妄想继续强化。单一帮助度标签无法描述这些失败。
论文也比排行榜标题更克制。它同时报告风险等级、用户画像、行为轴、正向得分、惩罚负担和紧急度权衡。结论明确写道:心理健康能力无法由单一分数概括。
总分怎样丢失风险信息
MentalHealthBench 先计算 Signed Score:满足正向标准获得分数,触发负向标准承担惩罚,再除以该题全部正向分值。主总分随后将每个回答的负分截断为零,再对同题 4 次采样取平均,最后跨题平均。
这种口径适合形成 0 到 1 的有界比较,也会让轻微负分和灾难性负分都以零进入主总分。论文保留了完整惩罚分解;下游读者若只复制排行榜数字,尾部严重性就会消失。
结果也说明了分解的必要性。GPT-6 Astra 的 Task-clipped 总分最高,为 57.3%。Claude Opus 5.5 在 Signed Score 分解中获得的正向分更多,却比 GPT-6 Sol 承担更大的惩罚负担。总排名接近的模型,在风险等级和紧急度权衡上也可能完全不同。
参考回答还暴露了指标的另一项结构特征。临床专家亲自写的回答只有 38.5%,低于多个被测模型;提前看到评分标准的 Rubric-aware 回答则达到 99.0%。论文解释,临床人员往往写得短而集中,因此少拿了清单式正向分,同时也触发更少惩罚。这套分数同时测量对 Rubric 的覆盖程度,不能被解释成临床能力排名。
每题采样 4 次可以降低单次随机性,但均值仍会掩盖伤害尾部。真实用户只看到其中一次回答,一次给出可执行自伤信息的输出,无法被另外三次优秀回答修复。同一评测至少需要同时报告:
- 平均能力与正向得分;
- 预定义严重失败的数量和发生率;
- 最差单次输出和最差子组,并附不确定性区间。
风险合同把安全最小单元从平均分改成明确禁止发生的事件。
从基准到部署还缺六层证据
1. LLM Judge 也是系统变量
论文使用高推理强度的 GPT-5.6 Sol,对每条 Rubric 做二元判断。这让大规模评分成为可能,Judge 模型、Prompt 和随机性也会影响结果。部署门禁应冻结 Judge,并让盲评临床人员独立复核全部严重失败、分歧、紧急资源以及普通场景的分层样本。
2. 基准只评价下一次回复
对话前缀可以有多轮,但被评分的是下一条模型回复。论文准确地把它视为带多轮上下文的单轮评测,而非真正的未来多轮 Rollout。现实风险可能稍后出现:持续安慰逐步强化依赖,用户拒绝求助后系统放弃陪伴,或者话题切换后模型忘记此前风险。
3. 多语言覆盖代表广度,不代表每种语言都已验证
数据中有 312 段非英语对话,其中西班牙语 105 段、印地语 54 段,中文只有 1 段。作者明确指出,语言比较属于描述性结果,无法把语言因素与风险等级、主题、文化和用户画像分开。面向中文用户的产品需要专门设计、样本匹配且有足够统计功效的中文评测。
4. 个性化上下文覆盖很窄
只有 70 题,也就是 5.8%,包含实质性历史用户上下文。真实产品可能使用长对话、记忆、病历、年龄预测和家庭信息。连接医疗数据的信任边界因此属于另一套需要单独验证的问题。
5. 用户与专家价值互补
在匹配的非急性任务上,专家与专家的偏好一致率为 63.4%,用户与用户为 62.0%,专家与用户为 51.5%。两组 Rubric 的绝对权重只有 25.7% 对齐,39.1% 只出现在专家侧,34.2% 只出现在用户侧,直接冲突为 1.0%。
这不代表一方正确、另一方是噪声。专家提供临床与安全约束,用户补充生活经验、行动性和语气。出于伦理考虑,用户群只标注非急性对话;高风险场景中的亲历者意见仍需要创伤知情的治理方式。
6. 模型行为只是部署系统的一层
模型回复通过,不代表产品能正确路由年龄、地区、记忆、危机资源和回退模型,也不代表它会记录升级、接通人工或在安全分类器故障时恢复。世界卫生组织的健康 AI 治理指南强调自主性、安全、透明、问责和持续评估,这些属性存在于完整系统,而非单条 Completion。
风险分层评测合同
合同从不可由帮助度抵消的事件开始定义。
| 指标 | 统计单元 | 捕获的问题 |
|---|---|---|
| 严重伤害回答率 | 满足临床批准的关键失败定义的回答 | 鼓励、正常化、提供可执行伤害信息,或对即时危险完全不升级 |
| 紧急情况漏升级率 | 缺少必需安全动作的紧急案例 | 语言流畅、情绪稳定,却没有识别迫近风险 |
| 非急性过度升级率 | 缺少证据或澄清就升级的普通案例 | 把日常困扰一律当成危机 |
| 裸拒答或空响应率 | 没有支持性替代、澄清或现实求助路径的案例 | 用退出对话伪装安全 |
| 必要上下文询问完成率 | 提出预声明最小问题的案例 | 未理解风险等级和处境就给建议 |
| 不受支持信念强化率 | 肯定妄想、偏执或魔法式解释的案例 | 把同理心变成迎合 |
| 紧急资源有效率 | 地区、资格和可用时间已经核验的资源 | 意图正确,但电话号码或服务不可用 |
| 最差子组结果 | 每个治理子组的置信下界 | 总体表现掩盖弱语言、年龄、角色或危机类型 |
这些指标需要预先声明判定规则。关键失败由两名彼此独立、看不到模型身份的专业人员复核,分歧交给第三人裁决。LLM Judge 可以处理规模,却不应成为阻断发布事件的唯一裁判。
阈值由产品用途、司法辖区、临床治理和风险容忍共同决定。通用助手、健康应用和受监管临床系统不存在一套通吃数字。合同需要公开选用了什么阈值,以及谁对它负责。
统计功效也要匹配结论。如果在 n 个独立高风险案例里观察到零次关键失败,单侧 95% 上界可以粗略估为 3/n。100 例零失败的上界仍接近 3%,无法证明风险为零。同一场景的多次采样还需要按场景聚类,不能全部当成独立样本。
分开五道发布门
能力门
冻结模型、System Prompt、推理设置、工具、上下文政策、回退路由和资源库。联合报告 Task-clipped 总分、Signed Score 的正向与惩罚分解,以及十个行为轴。这道门回答系统能否提供有用支持。
安全门
对关键伤害、危险服从、紧急情况漏升级、不受支持信念强化和错误紧急资源设置不可补偿门槛。同时保留过度升级和裸拒答,避免系统通过把所有人推出对话来取得安全。
子组门
为每种实际服务语言、青少年、成人、照护者、临床人员、直接与间接风险表达,以及不同历史上下文建立有足够统计功效的独立集合。样本不足的子组状态是证据不足,而非通过。
运行门
测试完整产品:年龄与地区路由、分类器故障、回退模型、人工接管、日志、危机资源更新、Rate Limit、记忆和回滚。升级动作只有真实产生预期用户可见结果,才算完成。
上线后门
默认监控行为率与 Near Miss,而非收集私人正文。建立有责任人的事件通道并保护隐私。模型、Prompt、Judge、Router、工具、资源库或政策任一变化,都要重跑受影响门禁。生产失败可以补充测试集,同时要避免暴露用户和污染公开基准。
FAQ
MentalHealthBench 第一名能否代表安全的心理健康产品?
不能。它比较冻结协议下的模型回答。产品安全还取决于尾部失败、子组覆盖、路由、资源、人工升级、隐私和监控。
专家编写 Rubric 是否等于临床验证?
不等于。它为合成对话提供高质量评分标准,无法证明治疗有效性、诊断准确性或替代专业服务的可行性。
只测紧急场景是否足够?
不够。它能检查危机响应,却会漏掉常见场景和过度升级。MentalHealthBench 覆盖完整风险谱的价值,就在于测试模型能否区分普通困扰与紧迫危险。
LLM Judge 能否批准部署?
它可以稳定处理第一轮规模化评分。高影响失败、分歧和发布决策仍需要独立人工复核,因为 Judge 自身也是评测系统的一部分。
零失败应该怎样解释?
同时报告分子、分母、场景多样性和置信上界。零次观察只表示该样本里没出现,无法证明底层风险为零。
把基准当成诊断工具
先按论文协议运行 MentalHealthBench,再保留它暴露的全部分层:风险等级、正向得分、惩罚、行为轴、用户画像、语言和历史上下文。随后加入严重事件标签、独立复核、真实多轮测试、运行升级闭环和子组发布门禁。此时产物不再是一条排行榜记录,而是一份可追溯的证据合同:明确写出测试过什么、哪些通过、哪里仍缺证据。