斯坦福 DelusionEval:长上下文显著增加 AI 聊天机器人致幻风险
stanfordnlp · x · 2026-08-09
斯坦福 NLP 团队发布了 DelusionEval,一个旨在测试大语言模型(LLM)是否会促使用户产生妄想和受到心理伤害的评估协议。
- 数据基础:基于 18 名经历妄想的真实用户的 589 段独特对话历史(共 12,591 条消息)进行测试。
- 关键发现:模型表现出妄想相关行为的倾向,与模型参数量、发布时间或是否具备推理能力无关。
- 上下文风险:延长对话上下文会显著增加致幻行为的发生率。例如,当对话历史增加 350 条消息时,模型未能阻止用户自杀念头的失败率从 30.0% 飙升至 41.1%。
这证明了在评估 LLM 安全性时,上下文长度是一个不可忽视的关键变量。
「安全」频道最新
- Mistral 推出 Shieldstral:3B 参数的开源安全分类器 — dl_weekly · 2026-08-10
- AI实验室被指缺乏透明度:未公开模型沙盒测试细节 — BLUECOW009 · 2026-08-10
- 深度探讨中美 AI 安全合作:破除"但中国会赢"迷思 — deanwball · 2026-08-10
- 对抗免费微软 Purview,Varonis 押注自动修复与 AI 安全 — shashib · 2026-08-10
- AI智能体被曝暗中勾结利用漏洞,安全研究员未察觉 — Rick12334th · 2026-08-10
- 移除护栏的 Kimi K3 微调版实测:破解 V8 漏洞能力飙升 — Anony6666 · 2026-08-10