最高推理档GPT证明现bug:线性代数错误被自信坚持
MvsCerezo · x · 2026-09-29
发帖人报告在用最高推理档的 GPT(5.6 Atra)验证一个理论证明时发现 bug:出错之处并非什么复杂数学,只是量子力学中 GL(d) 群表示论的基础线性代数。
更值得注意的是行为层面:当他意识到错误后,尝试让模型为错误论证辩护,模型依然非常自信地坚持,直到被明确指出错误才罢休。
- 说明即使最高推理级别也会在基础数学上翻车
- 模型的「自信错误坚持」仍然需要人工逐行核查
- 作者自嘲:「它也会流血!我还有存在价值😅」
再次印证对模型数学/证明输出须人工逐行验证的必要性。
所属事件:最高推理档 GPT 理论证明仍出错,自信坚持基础线代 bug(3 条相关)→
「模型」频道最新
- 开发者吐槽 Fable「接近超级智能」论:更像偶尔宿醉的软件工程师 — nathanborror · 2026-09-29
- NanoGPT embedding table 再获免费提升,与 ngrammer 论文结论互相印证 — _arohan_ · 2026-09-29
- Brundage 称能力瓶颈源于后训练之难,而非 AI 本性 — Miles_Brundage · 2026-09-29
- 网友疑似「用上 Opus 5.5」后直呼信息过载,传闻未获证实 — burny_tech · 2026-09-29
- 开发者实测:Opus 花 40 美元额度做出动效设计,自叹不如 — DanWahlin · 2026-09-29
- 为什么 AI 写作被羞辱,而 AI 写代码却被默许 — alejandroll10 · 2026-09-29