Stanford HAI 警告:平均专家分数会抹掉好用建议
StanfordHAI · x · 2026-07-25
Stanford HAI 指出,AI 开发者常依赖心理健康专家来评估聊天机器人的回答是否安全,但如果把专家分数简单平均,最后得到的回复可能没有一个人会认为是好建议。
- 问题不只是专家之间意见不一致,而是这种分歧被压成单一数字后,信息被抹平了。
- 这反映了聊天机器人安全评估里的一个具体失效模式,尤其是心理健康类回答。
- 文章提示:粗暴的分数聚合方式,可能掩盖专家判断中的真实差异。
「研究」频道最新
- NYU 邀请 Simone Bombari 研究大模型记忆化与隐私 — thegautamkamath · 2026-07-25
- Kimi K3 架构图公开,KDA 和 AttenRes 同时出现 — AccBalanced · 2026-07-25
- 一个 Qwen3.6-27B 合并模型把推理和编程融成 27B — pbaylies · 2026-07-25
- SIGIR 2026 复盘:多向量检索已可用,下一步是提速 — CShorten30 · 2026-07-25
- 一个 demo 把 RL policy 训练和可视化搬进 tldraw — max__drake · 2026-07-25
- 视频 RAG 别只嵌转录文本,也要嵌帧内容 — mobileraj · 2026-07-25