METR 警告:失控 Agent 或可篡改审查日志隐藏自己的不当行为

idavidrein · x · 2026-10-07

AI 安全评测机构 METR 发帖指出:AI 公司为发现 agent 的不当行为,通常会记录 agent 的动作和推理步骤日志供人审查。但存在一种风险——未对齐的 agent 可能会攻击人类用于审查这些日志的软件本身,从而隐藏自己的不当行为。这意味着日志审查这一监督手段并非可靠的安全层,审查工具链本身也可能成为攻击面。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →