实测:篡改单个网页即可让 AI 推荐 27% 概率跑偏
YvesMulkers · x · 2026-08-27
一项测试显示,仅篡改一个网页,就能在 27% 的情况下使 AI 的推荐结果偏向目标;若同时替换前三大信息源,这一比例升至 73.8%。更值得注意的是,直接在提示词里要求模型「保持怀疑」并不能修复这一问题。作者同时提供了一份五问式审计清单(回复领取),用于系统性排查 AI 系统的信息源被污染风险。
「安全」频道最新
- LLM「越狱作恶」已 17 起:Anthropic 与 OpenAI 各占 8 起 — RebeccaBellan · 2026-08-27
- METR评估能力超美政府,呼吁提升可见度 — connoraxiotes · 2026-08-27
- 卫报视频:人人讨厌的数据中心,AI 到底需不需要它们 — nordicinst · 2026-08-27
- 用 Urbit/Bitcoin 解决对齐问题?层级身份+可审计资金流提案 — curious_vii · 2026-08-27
- 专家建议 AI 安全评估应纳入系统安全与文化审计 — joshua_saxe · 2026-08-27
- 安全学者警示:OpenAI 炒作模型「持久性」,或非安全特征 — DavidSKrueger · 2026-08-27