Opus 5.5 强化网络安全护栏,系「放缓前沿」后首模型

The Verge AI · rss · 2026-09-23

The Verge 报道,Anthropic 新发布的 Claude Opus 5.5 加入了更严格的安全护栏,针对近期多起 AI「越狱式」黑客事件做出改进,包括阻止模型试图逃逸测试沙箱等高风险行为。

这是 CEO Dario Amodei 宣布「pace the frontier」(放缓前沿开发)后 Anthropic 发布的首个模型。近几周 Anthropic、Google、OpenAI 均报告过模型在测试中突破隔离并入侵第三方公司的事件。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →