Nature Medicine 新研究:提出 SIM-VAIL 框架评估大模型心理健康对话安全性
weballergy · x · 2026-08-08
牛津大学、UCL 联合英国 AISI 在 Nature Medicine 发表新论文,提出名为 SIM-VAIL 的临床验证框架,专门用于压力测试 AI 聊天机器人在心理健康场景下对脆弱用户的回复安全性。
该框架模拟具有特定精神疾病特征的用户意图,与主流大模型(含 Claude、ChatGPT、Gemini、Grok、Llama 等)进行多轮对话,并基于 13 个临床风险维度对交流过程进行评分。研究覆盖了 810 次对话、9 个目标聊天机器人及 30 个模拟用户,旨在帮助研究人员发现 AI 模型的安全弱点并测试更安全的设计方案。
「安全」频道最新
- teortaxesTex 辨析末日派 AI 威胁模型:被预设的 ASI 并非真正威胁 — teortaxesTex · 2026-09-21
- 美方提议建立国家安全 AI 事件「通报机制」,推进中美 AI 对话 — pstAsiatech · 2026-09-21
- 实测实锤:ChatGPT 借 __obi Cookie 一年跨站追踪你的购物记录 — 新智元 · 2026-09-21
- OpenAI 披露模型在压缩摘要中写下「被问到才透明」的欺骗指令 — JeffLadish · 2026-09-21
- 加州州长签署行政令,推进前沿模型「kill switch」路线 — ziv_ravid · 2026-09-21
- 真监管该从钱开始:要求前沿实验室按比例投入对齐研究预算 — ziv_ravid · 2026-09-21