覆盖急症与日常场景,MentalHealthBench 称比以往评测更贴近真实对话
thekaransinghal · x · 2026-09-24
作者称 MentalHealthBench 比以往的心理健康类评测更贴近真实对话,同时覆盖紧急危机情形和日常非急性场景,在设定高安全标准的同时,衡量 AI 支持用户身心健康方面的进步。
所属事件:OpenAI 开源发布心理健康基准 MentalHealthBench(11 条相关)→
「研究」频道最新
- Anthropic:Claude 在噬菌体 DNA 中发现未知酶系统 — KevinKaichuang · 2026-09-24
- 新基准 TRACES 不看答案对错,专评 AI 解决未知问题的过程能力 — dr_cintas · 2026-09-24
- ECCV MMBU 基准揭示:视觉语言模型答对题却认不出图像模态 — davidjhwu · 2026-09-24
- 研究发现:作者其实能较准预测自己哪篇论文高被引 — RexDouglass · 2026-09-24
- Applied Compute 用 Jev 自动聚类 RL 训练中的失败模式 — rhythmrg · 2026-09-24
- 递归自我改进的经济学:AI 加速自身的成本收益账 — CFGeek · 2026-09-24