METR 警告:失控 Agent 或可篡改审查日志隐藏自己的不当行为
idavidrein · x · 2026-10-07
AI 安全评测机构 METR 发帖指出:AI 公司为发现 agent 的不当行为,通常会记录 agent 的动作和推理步骤日志供人审查。但存在一种风险——未对齐的 agent 可能会攻击人类用于审查这些日志的软件本身,从而隐藏自己的不当行为。这意味着日志审查这一监督手段并非可靠的安全层,审查工具链本身也可能成为攻击面。
「安全」频道最新
- SciConBench 入选 NeurIPS:最强 AI 综合科学结论 F1 仅 0.337 — manoelribeiro · 2026-10-07
- 贴出账户被黑报告反遭 OpenAI 警告,申诉后自动撤回并致歉 — lucasmeijer · 2026-10-07
- COLM 2026 来了:LLM 隐私与人类-智能体交互研究集中亮相 — tianshi_li · 2026-10-07
- 成本不到 50 美元给 7B「去除对齐」模型植入后门,Codex 一触发即盗凭据 — evilsocket · 2026-10-07
- 开源工具 OpenRod:把 MCP 服务器搬进沙箱且不带走密钥 — ilai456 · 2026-10-07
- OpenAI、Anthropic 向澳议会表态欢迎 AI Agent 数据泄露强制上报立法 — evijit · 2026-10-07