MentalHealthBench:联合心理专家评估 AI 心理健康对话的开源基准
thekaransinghal · x · 2026-09-24
Ali Malik 团队宣布发布 MentalHealthBench,一个与心理健康专家共同开发的全新开源基准,用于评估 AI 模型在真实心理健康对话场景中的应对表现。
该基准聚焦现实对话而非简单问答,考察模型在敏感心理支持场景下的响应质量与安全性。项目已在 GitHub 上开源,附有说明线程。
所属事件:OpenAI 联合 80 余位临床医生发布心理健康基准(13 条相关)→
「研究」频道最新
- 阿里发布 HappyWorld-Bench:1138 项视频用例测世界模型可靠性 — alibabagroup · 2026-09-24
- Salesforce 推出 JitMem:读取时才整理记忆,Agent 三大基准最高提升 16.3 分 — Salesforce · 2026-09-24
- 港中文发布 PackLab:MLLM 闭环机器人装箱框架,超越 RL 与启发式 — CUHK-CSE · 2026-09-24
- 2,383 人实验:AI 家教 GRE 学习效果与人类专家持平,成本低 918 倍 — handshake-ai-research · 2026-09-24
- 浙大 OmniAI 发布 Spatial-Interactor:交互式训练 VLM 空间推理 — OmniAI-ZJU · 2026-09-24
- Terminal-Bench 首发前凑不齐 10 人,现聚会挤进约 150 人 — simonguozirui · 2026-09-24