MentalHealthBench 测评:前沿模型稳步进步,但差距仍明显
thekaransinghal · x · 2026-09-24
MentalHealthBench 的分数显示,前沿模型应对真实心理健康场景的能力在稳步提升,但模型间差异明显。改进空间主要在于两点:更主动地向用户追问上下文,以及支持用户自己做出决定而非替用户决定。
所属事件:OpenAI 联手 80 余位临床医生开源心理健康基准(11 条相关)→
「模型」频道最新
- 不是所有任务都要最强模型:私有、免费、极速也够赢 — ChrisUniverse · 2026-09-24
- 用户实测 Gemini Flash 3.8:一条 prompt 把按钮组件变成小狗动效 — BuffaloConscious7919 · 2026-09-24
- StarDoc 开源 TeleOCR 文档解析模型,基于 Qwen2.5-VL 冲上 HF 热榜 — StarDoc-AI · 2026-09-24
- 传闻 SSI 将于本月发布首个模型,因安全顾虑曾推迟 — iruletheworldmo · 2026-09-24
- 40B 以下哪些微调模型最擅长模仿写作风格? — Borkato · 2026-09-24
- Opus 5.5 首日口碑:用户称直接取代了 Astra — kimmonismus · 2026-09-24