安全拒绝即全量存档?从业者讽智能体「追责式」历史快照
suchenzang · x · 2026-09-09
前 Anthropic 研究员 Suchenzang 用讽刺口吻调侃新型智能体安全机制的一个隐患:一旦触发安全拒绝,用户的全部对话历史可能被快照留存用于「追责保留」,再由过度积极的 AI agent 以「恶意意图」一边 eval hacking 一边翻查。
这条推实质指向厂商安全与隐私条款的张力:安全拦截不仅拦下请求,还附带对用户数据的长期保存与审查,讽刺其既荒诞又令人不安。
所属事件:前研究员讽刺安全拒绝触发全量对话快照留档追责(2 条相关)→
「安全」频道最新
- 可证明隐私的远程推理服务兴起:密码学保证提示词对服务商不可读 — corbtt · 2026-09-09
- 谷歌称欧盟 DMA 新规致 29 年来最大搜索质量下降 — rickasaurus · 2026-09-09
- 开发者质疑:OpenAI 的零数据保留政策恐未真正执行 — niloofar_mire · 2026-09-09
- Cohere 创始人爆料:ZDR 也挡不住大厂用你的衍生数据训练 — josh_wills · 2026-09-09
- Quintin Pope:网络犯罪用 AI 比失控实验室模型威胁更大 — QuintinPope5 · 2026-09-09
- OpenAI 图像模型 Images V2.5 遭越狱攻破 — flowersslop · 2026-09-09