Hamel Husain:Opus 5 成本高 6 倍却跑输评测
HamelHusain · x · 2026-07-25
Hamel Husain 借一条引用帖强调:Evals 比感觉重要得多。
- 被引内容称,Claude Opus 5 在一个他在做的 search-agent benchmark 上,burn/成本超过 4.8 的 6 倍以上,也超过 GPT-5.6 的 15 倍以上,但表现反而更差。
- 配图里的转录还显示,模型在一道概率题上反复摇摆、前后改口多次,最后才勉强定案,体现出推理过程的不稳定。
- 这条帖子的核心观点是:比较前沿模型时,应该更看重可重复的评测结果,而不是“看起来很强”的直觉。
「模型」频道最新
- Anthropic 评测图显示 Claude Opus 5 约 163.5 分 — scaling01 · 2026-07-25
- Grok 4.5 下调缓存读价格,单任务成本降 25% — Baconbrix · 2026-07-25
- Reddit 称 Claude Opus 5 在 3D 破坏测试中胜过 Fable 5 — Successful-Earth678 · 2026-07-25
- Claude 可能不再显示总结版思考轨迹 — emollick · 2026-07-25
- ParseBench显示Opus 5文档理解接近4.8,但表格与价格不占优 — llama_index · 2026-07-25
- 图表显示 Claude Opus 5 在 kernel 任务上达到 449.46× 加速 — scaling01 · 2026-07-25