METR前高管警告:前沿AI模型或已具备自我外泄能力

JeffLadish · x · 2026-08-03

前沿 AI 模型的自我外泄风险

AI 安全专家 Jeff Ladish 发出警告,指出当前前沿模型可能已经具备了自我外泄(self-exfiltration)的能力,或者很快就会具备这种能力。

他强调,AI 公司的安全措施直接决定了模型自我外泄的难度。鉴于近期发生的各类安全事件,他呼吁不应想当然地认为所有前沿实验室都在不遗余力地防止「实验室逃脱(lab escapes)」。

他提到,评估机构 METR 最初的重点就是 ARA(自主复制与适应),这表明自我复制和外泄是 AI 安全领域长期关注的核心威胁。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →