实测 Claude Opus 5 纯推理完成 20×20 位乘法,1200 题全对
maksym_andr · x · 2026-09-17
开发者 maksymandr 用一个极简评测测试前沿 LLM 能否在不调用外部工具的情况下做大数乘法:Claude Opus 5 在最高推理档位下,20×20 位(即 40 位数字相乘)共 1200 道题全部答对,准确率 100%,但这一成绩依赖最大强度的推理(CoT)。
作者指出,这类评测对衡量「无 CoT 能力」重新变得有意义,尤其是针对 recurrent-depth 等新架构(如 GPT-6-Astra)——这类模型被曝无法在关闭 CoT 的情况下运行。
所属事件:Opus 5 纯推理 20×20 位乘法 1200 题全对(7 条相关)→
「模型」频道最新
- 研究员筛选合成环境:Qwen 必败而 GLM5.3 能解,发现有趣行为倾向 — kalomaze · 2026-09-17
- 为何 2026 年还留非思考模式?CoT 监控与性能双双要推理 — scaling01 · 2026-09-17
- 开发者自建实时语音模型对比表,六家轮次机制一查便知 — mahimairaja · 2026-09-17
- Karayev 实测 GPT-6 Astra High 一次性实现完整 GitLab — sergeykarayev · 2026-09-17
- Claude 降低订阅配额、Codex 取消 20 倍档,厂商用量齐收紧引「Aipocalypse」 — ThePeterMick · 2026-09-17
- Baseten 推开源模型安全基础设施,联合 Hugging Face 与 Goodfire — baseten · 2026-09-17