22 国 80+ 精神科专家标注 1215 段对话,构建 AI 心理健康评测基准

thekaransinghal · x · 2026-09-24

MentalHealthBench 的核心构建方法:

推文串还指出:前沿模型在心理健康场景的回应能力稳步进步,但模型间差异明显——各模型在「追问上下文」上差距很大,而共情与支持表现则较为一致;整体分相近的模型在不同维度上各有强弱,后续改进空间主要在上下文追问与用户自主性支持。

所属事件:OpenAI 开源发布心理健康基准 MentalHealthBench(11 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →