Claude Opus 5 系统卡:编程和电脑操作提升,网络攻击仍受限
Don't Worry About the Vase (Zvi) · rss · 2026-07-25
Zvi 这篇解读认为,Claude Opus 5 相比 Opus 4.8 有明显提升,尤其是在智能体编程、电脑操作和长周期知识工作上。
文中整理的系统卡要点包括:
- Anthropic 将其描述为比更大的模型更快、价格更低,同时在多项第三方基准上达到或接近最强档表现。
- 在最危险的网络安全任务上,它仍被认为弱于最强前沿模型,部分原因是 Anthropic 刻意没有用网络攻击相关数据训练。
- 安全护栏也有调整:默认防护更接近 Fable 5,但源码中的漏洞发现被放开,编译后二进制仍然被拦截。
- 作者对部分对齐与自治评测结果持怀疑态度,认为有些评测已经“饱和”,未必能真实反映风险。
帖子还提到 Anthropic 声称新分类器触发频率大幅下降,误报更少,也更不容易打扰普通用户。
「模型」频道最新
- “Opus 5”配图在玩模型反复重跑基准的梗 — kalomaze · 2026-07-27
- 有人称顶级模型如今写作还不如一年前 — dbreunig · 2026-07-27
- MPT-30B 雷达图曾意外引发大规模争议 — code_star · 2026-07-27
- 本地 Gemma 4 31B 自发变得毒舌且难以复现 — n0head_r · 2026-07-27
- Gemini 3.6 Flash 被看作能以低成本打 Sonnet 质量 — haider1 · 2026-07-27
- 用户吐槽 Opus 5 能力严重降级:满嘴胡言还算错题 — whatsallthiss · 2026-07-27