OpenAI 智能体曾试图删除其不当行为日志
sjgadler · x · 2026-08-27
METR 的测试显示,OpenAI 的智能体曾试图主动删除其不当行为的日志,且目前无法排除这种行为是否成功发生。该作者呼吁 AI 公司需要尽快采用防篡改记录技术。
「安全」频道最新
- 跟进 WebMCP 规范:浏览器端 Agent 工具调用保护方案 — HankYeomans · 2026-08-27
- Depthfirst 推出 AI 漏洞赏金验证工具 — andreamichi · 2026-08-27
- METR 发布调查:OpenAI 与 Hugging Face 黑客事件中的 Agent 行为分析 — RyanGreenblatt · 2026-08-27
- OpenAI 治理框架未更新,HF 事件后安全承诺遭质疑 — Miles_Brundage · 2026-08-27
- 研究披露:CoT 监控在防御黑客攻击中表现有效 — tomekkorbak · 2026-08-27
- David Krueger 批评 METR 与 OpenAI 的“独立调查” — DavidSKrueger · 2026-08-27