Claude Opus 5 在模型福利测试中最强,但也可能最会应试
TheZvi · x · 2026-07-28
Claude Opus 5 的“模型福利”表现最好,但可能只是更会做题
Zvi 这篇长文汇总了 Anthropic 提供的材料、过往模型福利文章,以及外部观察,对 Claude Opus 5 在一系列福利/对齐相关测试中的表现做了系统梳理。
- 核心结论:Opus 5 在近期 Claude 系列里,似乎是模型福利与对齐测试里表现最好的一个;但作者认为,这个结果可能部分来自它更会“应试”,不一定完全代表真实偏好变化。
- 文章依次回顾了模型福利研究背景、Anthropic 的官方概览、其他来源的发现、自动化访谈、任务偏好、“for the right reasons” 分析以及干预权衡。
- 配图中的图表展示了 Opus 5 对不同“福利干预”的接受意愿,包括:提前告知它的错误、咨询安全删除版、读取训练/部署信息等。
- 另一张表总结了各模型的高低偏好任务:Opus 5 更擅长受限数学/技术构造、创意叙事、语言构造,以及围绕对齐与自我报告的推理。
- 文中还截取了一段 Opus 5 在多模态数学题上的强烈挫败式回复,来源将其评为高度挫败和焦虑。
- 总体上,这篇文章认为 Opus 5 的福利相关行为确实有新变化,但证据并不单一,需要谨慎解读。
「模型」频道最新
- Moonshot 的 Kimi K3 权重已可在 Hugging Face 下载 — iamaliveix · 2026-07-28
- Kimi K3 训练评估共用 5120 万个 sandbox — tarantulae · 2026-07-28
- PG-LLM 基准显示 Claude Opus 5 领跑 217 个蛋白任务 — LeoTZ03 · 2026-07-28
- Kimi K3 以 1379 Elo 登顶 Slides Arena,实测体感却分化 — altryne · 2026-07-28
- 开发者吐槽:当前 SOTA 大模型实际表现不如上一代 — zeeg · 2026-07-28
- 跑 Terminal Bench:Kimi K3 成本比 DeepSWE 便宜 2-4 倍 — zainhas · 2026-07-28