Zvi 精读 Claude Opus 5.5 系统卡:生物评测改用免拒答设计
Don't Worry About the Vase (Zvi) · rss · 2026-09-24
Zvi Mowshowers 逐节精读 Anthropic Claude Opus 5.5 的系统卡。该模型在标准评测上被称为当前最强,且比 Opus 5 更便宜,Anthropic 宣称其整体优于 Fable 5.1。
要点:
- 分类器与部署:五类风险分类器(化生、网络、武器、蒸馏攻击等),网络滥用类回退到 Opus 4.8,化生类回退 Opus 5;蒸馏攻击直接拦截且无回退。
- RSP 评测:化生能力被评为 CB-1 而非 CB-2,自治风险与 Mythos 5.1 相当或略高,远未触及 Autonomy-2 阈值,部署保障与上代一致。
- 重大政策变化:Anthropic 不再测试 helpful-only 版本,改用设计为避免拒答的评测集(如 16 小时细菌治疗红队演习、RNA 序列设计、AAV 包装预测),理由是相关能力本质双用途。Zvi 指出此举有代价:部分评测因拒答问题被砍,团队也因拒答损失时间。
- 生物评测表现:Opus 5.5 在黑盒 RNA 序列设计上创历史新高,但开放性科学推理仍弱——过度依赖摘要而非全文,甚至设计出编码错误蛋白的 DNA;红队中专家队平均更好但最高分是普通团队。
- AI R&D:自动化研究能力在改进但属正常趋势内,距 Autonomy-2 阈值尚远;主要瓶颈在认识质量与指令遵循。
Zvi 总体判断:局面没有实质变化,但他质疑若由有资源的生物团队主导,实际风险上限可能高于评测所示。
「模型」频道最新
- 传 Anthropic 发布 Claude Opus 5.5:对标竞品性能,典型成本直降 40% — rohanpaul_ai · 2026-09-24
- 受够了模型过度拒绝:用户转用无审查开源模型干活 — Khaledthe · 2026-09-24
- Jev 40 秒拆解 37 个品牌 724 条广告,仅花 0.09 美元 token — sibraan_ · 2026-09-24
- 网友连聊 Opus 5.5 一小时后感叹:「这个行业完蛋了」 — TAbrodi · 2026-09-24
- 用户实测:Opus 5.5 编码遥遥领先,周用量几乎不降 — CtrlAltDwayne · 2026-09-24
- Instinct 回应数据泄露质疑:称系幻觉而非数据隔离失效 — mon__lim · 2026-09-24