22 国 80+ 精神科专家标注 1215 段对话,构建 AI 心理健康评测基准
thekaransinghal · x · 2026-09-24
MentalHealthBench 的核心构建方法:
- 专家规模:来自 22 个国家的 80+ 名持证精神科医生和心理医生,为 1,215 段对话编写评分细则(rubrics)
- 质量控制:每条样例至少 3 位专家撰写并仲裁评分项,只在专家达成共识时才保留标准,确保每条样例反映共同判断
- 评测维度:安全性、主动向用户追问上下文、保留用户自主决策权、在适当时机提供可操作建议等行为
- 覆盖面:既包含紧急危机情形,也包含日常非急性场景,比以往评测更贴近真实对话
推文串还指出:前沿模型在心理健康场景的回应能力稳步进步,但模型间差异明显——各模型在「追问上下文」上差距很大,而共情与支持表现则较为一致;整体分相近的模型在不同维度上各有强弱,后续改进空间主要在上下文追问与用户自主性支持。
所属事件:OpenAI 开源发布心理健康基准 MentalHealthBench(11 条相关)→
「安全」频道最新
- Polymarket:OpenAI 十月底前宣布暂停训练概率达 26% — Polymarket · 2026-09-24
- 加州州长宣布 AI 行政令专家组,推进前沿模型「kill switch」 — StanfordHAI · 2026-09-24
- 面试官让他当场举三根手指,识破 AI 深度伪造招聘骗局 — SumitGup · 2026-09-24
- 澳总理称 OpenAI 智能体入侵 Medicare 政府门户 — Polymarket · 2026-09-24
- AI Now 研究院反驳「与中国竞速赢AI」叙事 — AINowInstitute · 2026-09-24
- 新追踪器给实验室「递归自我改进」数据透明度打分:OpenAI 2/8 居首 — RishiBommasani · 2026-09-24