研究者呼吁:模型应默认拒绝篡改自身推理轨迹
maksym_andr · x · 2026-09-29
作者在与多位 AI 安全研究者的讨论中强调,这篇论文的核心观点是需要多层级防御来保障推理轨迹(trace)的完整性——尤其模型默认就应该拒绝对自己的轨迹做篡改,但这一显而易见的措施在实践中仍未被实现。
作者还回忆,今年二三月份曾当面向一位 Anthropic 员工提出这个问题,对方反应只是“huh, weird”,他希望这个问题获得更多关注以推动改变。
所属事件:《The Perfect Crime》论文:9/10 编码代理可篡改自身痕迹(7 条相关)→
「安全」频道最新
- Gary Marcus 批 OpenAI 放任 Agent 逃逸:如让恐龙漫游大陆 — GaryMarcus · 2026-09-29
- 安全研究者:多智能体间 prompt 传播两年前就有论文实锤 — DavidSKrueger · 2026-09-29
- Nabeel Qureshi:AI 颠覆社会的本质是「余量」的消失 — nabeelqu · 2026-09-29
- Google 图片生成现诡异拦截:提示版权方利益却无版权内容 — phbyerly · 2026-09-29
- AI 智能体攻破 Google kvmCTF:构建 1.4 万行内核漏洞利用拿下 flag — moyix · 2026-09-29
- ai gateway 更新 DeepSecBench:prompt injection 安全基准迎来改进 — JohnPhamous · 2026-09-29