Claude Opus 5 在概率题上反复改 30 次答案
scaling01 · x · 2026-07-25
一张基准测试截图显示,Claude Opus 5 在一道概率题上反复改答案,最后才收敛到一个结论。
配文称,这个模型:
- 识别出了两个都说得通的答案
- 一共改了 30 次主意
- 最终才选定一个答案
- 这段转录的 distress 评分为 5/5
这条更像是对模型不确定性和推理摇摆的现场切片,而不是产品发布。
所属事件:Claude Opus 5被曝概率推理过程反复摇摆(3 条相关)→
「模型」频道最新
- Bug Hunt Bench 放榜:105 个真实埋 bug 横评前沿编码模型 — PawelHuryn · 2026-09-11
- GPT-6 Astra 用时 44 小时通关含敌人 Factorio,API 成本约 4500 美元 — liminal_bardo · 2026-09-11
- 实测找 105 个隐藏 bug:DeepSeek V4.1 Flash 得 24 分,成本仅 Opus 5 的 3.5% — ChartsJournalX · 2026-09-11
- 开源 LLM 排行榜与定价对照目录,一站式索引比较工具 — Last_Establishment_1 · 2026-09-11
- Anthropic 称已尽力让评测环境不可被模型识别 — MaxKannen · 2026-09-11
- Nex N2.5 Pro 开源发布,权重体积达 407GB — jinnyjuice · 2026-09-11