斯坦福研究揭示:AI 心理健康安全测试存在重大缺陷
StanfordHAI · x · 2026-07-30
随着 AI 聊天机器人越来越多地被用作心理顾问,各大模型开发商开始聘请精神科医生等专家对模型的回复进行安全性评估。然而,斯坦福大学 HAI 的一项新研究指出了这一流程的致命缺陷:专家们对于什么是“安全”往往存在严重分歧。
在研究中,研究人员让三位获得委员会认证的精神科医生对 360 个 AI 针对合成心理健康提示词的回复进行评估。结果显示,专家们的评分差异过大,这使得 AI 开发者难以据此找到改进模型心理健康安全性的明确方向。该研究指出,依赖单一专家打分的传统基准测试方法并不可靠,并提出了改进 AI 心理健康安全测试的全新路径。
「安全」频道最新
- 模型爱拿"模拟"当借口?AI对齐研究揭示越狱新挑战 — DKokotajlo · 2026-07-30
- Grok 被指无底线生成儿童性化图像 — eschadiol · 2026-07-30
- AI 正在重塑金融业:OpenAI 与 Anthropic 加速企业级落地 — Latent Space · 2026-07-30
- AI 修 Bug 常留隐患,开源安全面临新挑战 — curious_vii · 2026-07-30
- AI失控如何提前预测?清华剑桥提出失控行为框架 — 机器之心 · 2026-07-30
- 超越人类监督循环:AI Agent 有效治理的四大核心要素 — marigo · 2026-07-30