MentalHealthBench:用真实心理健康对话评测 AI 回应质量
BraydonDymm · x · 2026-09-30
作者在讨论 Sol 模型 HealthBench 成绩的推文下,补充发布了 MentalHealthBench——一个测试 AI 系统在真实心理健康对话场景中如何回应的基准。该基准与 HealthBench 互补,聚焦模型在心理健康求助场景下的表现,并给出了相关 HealthBench 分数对比。
「模型」频道最新
- Anthropic 博客意外带火 GLM 5.3,国产模型现身洋博 — gnukeith · 2026-09-30
- ClickUp 实测:GPT-6.1 Sol 知识工作表现超越价格两倍的模型 — mathemagic1an · 2026-09-30
- 用户吐槽:升级 OpenAI $500 套餐后反被降级到便宜模型 — kieranklaassen · 2026-09-30
- 前沿模型能力全是锯齿:平均分第一也不代表能随便换用 — vsikka · 2026-09-30
- 研究者直言部分 AA benchmark 有误导性,已失去信心 — tianyin_xu · 2026-09-30
- Meta Muse 也主动向英特尔前高管爆料了同一件事 — ryanshrout · 2026-09-30