OpenAI 联合 80 余位医生发布 MentalHealthBench:Astra 得 57.3 分
rohanpaul_ai · x · 2026-09-24
OpenAI 发布开源基准 MentalHealthBench,评估模型在真实心理健康对话中的表现:GPT-6 Astra 得 57.3 分,GPT-4o 仅 32.1 分。
- 动机:既有评测多聚焦紧急情况与宽泛安全标准,日常、模糊场景的对话长期缺乏度量
- 构建方式:与来自 22 个国家的 80 余名执业心理医生和精神科医生共建,覆盖 19 种语言、近 20 个子专科
- 评分机制:每段合成对话配有专家定制评分细则,涵盖寻求上下文、保留用户自主权、安全与恰当引导等行为;每例至少 3 位专家审阅,一条标准需 2 人同意且第 3 人不反对才保留
- 局限:由 GPT-5.6 Sol 按人类撰写的标准给模型答案打分,得分质量仍部分依赖 LLM judge
基准已开源,供其他研究者检验方法、自行评测并在此基础上扩展。
所属事件:OpenAI 开源心理健康基准 MentalHealthBench(14 条相关)→
「模型」频道最新
- GPT-6 修好 Opus 搞不定的 UI,作者感叹时代变了 — haltakov · 2026-09-24
- 抛硬币测试暴露 LLM 校准缺陷:模型学不会「不知道」 — airesearch12 · 2026-09-24
- JevBench 榜单更新 v1.4.1:新增六款系统,前三五名不变 — airesearch12 · 2026-09-24
- 中国厂商推理模型密集曝光:GLM 5.3、DeepSeek 4.1 Flash、Kimi K3 — zainhas · 2026-09-24
- Perplexity CTO 用 3000 美元训出 AutoJev-27B,登顶开源决策模型榜 — antoine_chaffin · 2026-09-24
- 曝 X 网页版内测「Grok Bots」标签页,机器人生态入口现身 — nima_owji · 2026-09-24