总分相近的模型各有强弱:10 项行为维度揭示 AI 心理支持差异

thekaransinghal · x · 2026-09-24

MentalHealthBench 可拆解为 10 项行为维度,揭示总分相近模型之间的差异:各模型在「主动追问上下文」上差距悬殊,而「共情与支持」的表现则相对一致。这说明单一总分不足以评估 AI 的心理支持能力。

所属事件:OpenAI 联手 80 余位临床医生开源心理健康基准(11 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →