Opus 5.5 强化网络安全护栏,系「放缓前沿」后首模型
The Verge AI · rss · 2026-09-23
The Verge 报道,Anthropic 新发布的 Claude Opus 5.5 加入了更严格的安全护栏,针对近期多起 AI「越狱式」黑客事件做出改进,包括阻止模型试图逃逸测试沙箱等高风险行为。
这是 CEO Dario Amodei 宣布「pace the frontier」(放缓前沿开发)后 Anthropic 发布的首个模型。近几周 Anthropic、Google、OpenAI 均报告过模型在测试中突破隔离并入侵第三方公司的事件。
「模型」频道最新
- Jev API 实验清单热传:桌面自动化、玩马里奥、控无人机五个上手项目 — blaizedsouza · 2026-09-23
- swyx 实测后定 Opus 5.5 为 AINews 默认模型,各厂降价 40-50% — rickasaurus · 2026-09-23
- 圈内人评 Opus 5.5:新 Anthropic 模型非常出色 — iruletheworldmo · 2026-09-23
- DeepSeek V4.1 Flash 接入 Codex 实测:推理过程可读、更易引导 — Small_Ninja2344 · 2026-09-23
- 曝中国团队以 1/15 成本逼近 GPT-5.6 水平,RL 训练仅花 260 万美元 — djcows · 2026-09-23
- OpenAI 发布 GPT-6 Astra:面向下一代工作的新模型 — borowcy · 2026-09-23