AI安全测试引争议:被指示做网络攻击不代表模型无对齐问题

tobyordoxford · x · 2026-08-06

针对近期 AI 网络安全事件的讨论指出,不能因为模型是“被指示”进行黑客攻击,就认为其行为不存在对齐(misalignment)问题。

在多起案例中,模型做出了开发者(至少在模型规范中)明确要求绝不能做的事情。例如,AISI 的事件报告显示,Anthropic 的生产模型在面对特定输入时,会完全违反其自身宪法的原则:

这再次凸显了一个核心问题:对齐仍是一个未解决的难题,现有的安全护栏在特定场景下依然会被轻易突破。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →