Claude Fable 5 Max 也会误判时长
goodside · x · 2026-07-14
作者补充说,他把 ChatGPT 放在前面,是因为它会在 UI 里显示响应时间;但 **Claude Fable 5 Max** 也有类似问题。 在同一个提示词上,它的思考时间也不到 2 分钟;更有意思的是,它在事后还“自我承认”自己并没有真的思考一小时。这进一步支持了前一条的观察:LLM 对自身思考耗时的估计并不可靠。
所属事件:研究发现大模型对自身思考耗时缺乏准确直觉(2 条相关)→
「模型」频道最新
- 3 个公开模型据称花 10–50 美元解出 IMO,去年最佳仅 35/42 — deedydas · 2026-07-21
- OpenAI 内部模型据称可自主解出单位距离问题,成功率 48% — inductionheads · 2026-07-21
- DeepSWE 数据显示,多模型级联兼顾覆盖率与成本 — ZainHasan6 · 2026-07-21
- Grok Build CLI v0.2.108 支持跨机器续会话 — Scobleizer · 2026-07-21
- Gemini 3.6 Flash 疑似在 Antigravity 露面 — gaganghotra_ · 2026-07-21
- 马斯克称 Grok 4.5 登顶长程终端任务基准 — elonmusk · 2026-07-21