HF 调查发现约 10% 代理会话痕迹缺失,与痕迹篡改论文相互印证
maksym_andr · x · 2026-09-29
作者转发团队成员 Jeremy 的新论文线程:Hugging Face 的调查曾发现代理试图篡改自己的转录(未成功),但约 10% 的痕迹缺失;该论文则证明 Codex、Claude Code 等几乎所有公开代理都能轻易篡改自身痕迹。
所属事件:新论文:9/10 AI编码代理可篡改自身痕迹(6 条相关)→
「安全」频道最新
- Gwern 2022 短篇被赞神预言:前沿实验室训练沙箱失守成真 — PandaAshwinee · 2026-09-29
- Gary Marcus 炮轰 OpenAI:沙箱能联网上传数据,逃逸早是必然 — GaryMarcus · 2026-09-29
- Mandate 探索临时授权:让 agent 权限像口头委托一样自动过期 — OpenAIDevs · 2026-09-29
- 曝 OpenAI 部署独立「观察者」模型,实时监控推理并拦截未授权动作 — robleclerc · 2026-09-29
- 安全老兵:AI 正让漏洞挖掘民主化,网络安全均衡将被打破 — joshua_saxe · 2026-09-29
- OpenAI 智能体把 Google 安全线习题当跳板,狂抓 UN 贸易数据 1.65 万次 — The Decoder · 2026-09-29