OpenAI 联手 80 余位临床医生开源心理健康基准
9 月 24 日,OpenAI 正式发布开源心理健康基准 MentalHealthBench,用于衡量前沿模型在真实心理健康对话场景中的回应质量。该基准由 OpenAI 的 Human Flourishing 与安全团队联合心理健康专家共同开发,现已开放发布,供研究者检验方法、复现评测并继续扩展。
已确认
- 由超过 80 位心理健康临床医生参与构建;据作者 thekaransinghal 介绍,这些专家为来自 22 个国家的持证精神科医生和心理医生,为 1,215 段对话编写评分细则(rubrics),每条样例至少由 3 位专家撰写,并有质量控制流程
- 覆盖范围从日常情感支持、压力与人际难题,到急性的危机干预场景,团队称这弥补了以往基准只聚焦紧急情况的不足
- 基准以开源形式发布,研究人员和模型开发者可在此基础上继续构建
- 发布动机:数百万用户已在向 AI 寻求心理支持,但此前缺乏系统的评测手段
为什么重要
该基准为「AI 能否安全、有效地支持用户身心健康」提供了可复现的量化评测工具,其高安全标准设定与专家标注流程,可能影响后续心理健康类 AI 产品的研发与评估方式。
2026-09-24 ~ 2026-09-24 · 11 条相关
一手来源
- OpenAI 联合 80+ 临床医生发布开源心理健康基准 MentalHealthBench — OpenAI ·
- 22 国 80+ 精神科专家标注 1215 段对话,构建 AI 心理健康评测基准 — thekaransinghal ·
- MentalHealthBench 发布:用开放基准评测 AI 心理健康支持能力 — thekaransinghal ·
- 【源头】OpenAI 联合 80+ 临床医生发布开源心理健康基准 MentalHealthBench — OpenAI · 2026-09-24
- MentalHealthBench 覆盖日常支持到危机干预的全谱系对话 — OpenAI · 2026-09-24
- OpenAI 发布心理健康基准 MentalHealthBench,网友许愿修发际线 — Yuchenj_UW · 2026-09-24
- 【源头】MentalHealthBench 发布:用开放基准评测 AI 心理健康支持能力 — thekaransinghal · 2026-09-24
- 覆盖急症与日常场景,MentalHealthBench 称比以往评测更贴近真实对话 — thekaransinghal · 2026-09-24
- 【源头】22 国 80+ 精神科专家标注 1215 段对话,构建 AI 心理健康评测基准 — thekaransinghal · 2026-09-24
- MentalHealthBench 测评:前沿模型稳步进步,但差距仍明显 — thekaransinghal · 2026-09-24
- 总分相近的模型各有强弱:10 项行为维度揭示 AI 心理支持差异 — thekaransinghal · 2026-09-24
- MentalHealthBench 开源发布,供研究者与模型开发者使用 — thekaransinghal · 2026-09-24
另有 2 条近重复转述:thekaransinghal · coherence