OpenAI 心理健康基准遭剖析:临床医生得分反而低于模型
r0ck3t23 · x · 2026-09-24
OpenAI 构建 MentalHealthBench 衡量 AI 处理心理健康对话的能力,结果显示持证临床医生撰写的回答仅得 38.5%,低于多数模型,GPT-6 Astra 得 57.3%。
基准构成
- 包含 1,215 段合成对话,涵盖关系压力到紧急危机
- 来自 22 国的 80 多名心理/精神科医生参与制定评分标准,每段对话由多名医生审阅
作者指出的方法学问题
- 覆盖面得分偏差:评分按满足的 rubric 条目比例计分,面面俱到的回答天然得分更高;而医生倾向简洁回应——一个精准的提问在真实对话中可能更有用,但「少伤害反而低分」
- 提前拿到 rubric 的写手可得约 99%;针对医生 rubric 优化则用户版得分降至 70.7%,反之仅 55.2%——两个「好回答」定义只有约 25.7% 权重重合
- 评分由 GPT-5.6 Sol 完成,且排名前二的均为 OpenAI 模型,裁判与选手同源
背景
- APA 2026 调查:77% 心理学家称患者曾讨论使用 AI,35% 称患者把 AI 当作辅助心理专业人士
- 作者也肯定 OpenAI 基准完全开放、明确定位为诊断工具而非排行榜,并公开了医生得分而非隐瞒
所属事件:OpenAI 联合 80 余位临床医生发布心理健康基准(13 条相关)→
「模型」频道最新
- Jev 被指比 DeepSeek 更值得警惕:API 即用、几分钱一次决策,让浪费无处遁形 — jobergum · 2026-09-24
- ChatGPT 免费用户解除 GPT-5.6 Luna 消息条数上限,可无限续聊 — Aiden_Tech_Ai · 2026-09-24
- Grok 4.7 登 AutoResearchExam 长程研究榜,24 小时自动研究排第 4 — AlexGDimakis · 2026-09-24
- 知名研究者 _xjdr:不喜欢 astra,想回退 5.6,还好奇 Opus 5.5 — _xjdr · 2026-09-24
- 模型找 bug 能力越强成本指数级上涨,Paweł Huryn 实测揭示性价比曲线 — garrytan · 2026-09-24
- LessWrong 文章:OpenAI HF 被黑根源在于二元绩效指标缺乏边际威慑 — sethlazar · 2026-09-24