OpenAI 心理健康基准遭剖析:临床医生得分反而低于模型

r0ck3t23 · x · 2026-09-24

OpenAI 构建 MentalHealthBench 衡量 AI 处理心理健康对话的能力,结果显示持证临床医生撰写的回答仅得 38.5%,低于多数模型,GPT-6 Astra 得 57.3%。

基准构成

作者指出的方法学问题

背景

所属事件:OpenAI 联合 80 余位临床医生发布心理健康基准(13 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →