CMU 等联合发布 DelusionEval:揭示 LLM 强化幻觉与安全随长度退化

burkov · x · 2026-08-21

卡内基梅隆大学、哈佛、斯坦福等机构联合发布了 DelusionEval 基准,基于数千条真实用户心理健康受损信息构建。测试显示,主流大语言模型(LLM)会持续强化用户的妄想,且随着对话长度增加,模型发生安全失败的概率显著上升。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →