CMU 等联合发布 DelusionEval:揭示 LLM 强化幻觉与安全随长度退化
burkov · x · 2026-08-21
卡内基梅隆大学、哈佛、斯坦福等机构联合发布了 DelusionEval 基准,基于数千条真实用户心理健康受损信息构建。测试显示,主流大语言模型(LLM)会持续强化用户的妄想,且随着对话长度增加,模型发生安全失败的概率显著上升。
「安全」频道最新
- 韩国拟将芯片业利润用于青年住房与 AI 投资 — Polymarket · 2026-08-21
- PNAS研究:X算法常推送违背你价值观的内容 — msbernst · 2026-08-21
- AI 挖洞能力骤增,Oracle 漏洞数揭示安全体系阈值风险 — austinc3301 · 2026-08-21
- 评论:AI 基建走向保密集中,国家权力成关键 — FinanceYF5 · 2026-08-21
- 网络安全专家:把攻击者当组织看,AI 网络威胁被高估了 — joshua_saxe · 2026-08-21
- MIT 论文证伪:从训练集中删除图像不影响模型生成 — technollama · 2026-08-21