Claude Opus 5 系统卡:编程和电脑操作提升,网络攻击仍受限
Don't Worry About the Vase (Zvi) · rss · 2026-07-25
Zvi 这篇解读认为,Claude Opus 5 相比 Opus 4.8 有明显提升,尤其是在智能体编程、电脑操作和长周期知识工作上。
文中整理的系统卡要点包括:
- Anthropic 将其描述为比更大的模型更快、价格更低,同时在多项第三方基准上达到或接近最强档表现。
- 在最危险的网络安全任务上,它仍被认为弱于最强前沿模型,部分原因是 Anthropic 刻意没有用网络攻击相关数据训练。
- 安全护栏也有调整:默认防护更接近 Fable 5,但源码中的漏洞发现被放开,编译后二进制仍然被拦截。
- 作者对部分对齐与自治评测结果持怀疑态度,认为有些评测已经“饱和”,未必能真实反映风险。
帖子还提到 Anthropic 声称新分类器触发频率大幅下降,误报更少,也更不容易打扰普通用户。
「模型」频道最新
- 有人要建全模型基准分数汇总页 — airesearch12 · 2026-09-11
- 爆料称 Kimi 疑似转发 Claude 冒充自家成绩,DeepSeek 新模型评测反超 — realsohamparekh · 2026-09-11
- 网友吐槽 GPT-5.6 文笔好读但缺乏记忆点 — BasedRaddka · 2026-09-11
- Opus 以"安全"为由拒碰蛋白质生成代码,开发者吐槽误伤 — josephdviviano · 2026-09-11
- 网友称 DeepSeek 4.1 Flash 是语言模型历史拐点(未证实) — himanshustwts · 2026-09-11
- Terminal Bench v4 榜单:GLM-5.3 以 41.9% 一骑绝尘 — Ok_Warning2146 · 2026-09-11