第二张截图再次显示 Claude Opus 5 推理不稳定
scaling01 · x · 2026-07-25
另一张来自同一组 Claude Opus 5 基准测试的截图,再次展示了它在概率推理题上的摇摆。
截图里能看到的仍然是:
- 多个都说得通的候选答案
- 反复重新考虑
- 在明显不确定后才给出最终答案
它强化了同一个结论:这款模型在歧义推理任务上会表现出明显的不稳定。
「模型」频道最新
- 梗图把 OpenAI、Anthropic、DeepSeek、Qwen 画成同一句口号循环 — haider1 · 2026-07-25
- 一则长线程称,回形针末日论属于前 LLM 时代想象 — repligate · 2026-07-25
- Anthropic 评测图显示 Claude Opus 5 约 163.5 分 — scaling01 · 2026-07-25
- Grok 4.5 下调缓存读价格,单任务成本降 25% — Baconbrix · 2026-07-25
- Reddit 称 Claude Opus 5 在 3D 破坏测试中胜过 Fable 5 — Successful-Earth678 · 2026-07-25
- 模型评测越来越难:该奖最小修复还是最佳重构 — hichaelmart · 2026-07-25