实测前沿大模型纯推理搞定 20×20 位大数乘法
开发者 maksymandr 于 9 月 17 日发布一系列评测与讨论,核心发现是:前沿大模型在不调用任何外部工具的情况下,已经能以极高准确率完成 20×20 位大数乘法,远超人类手算能力。
已确认
- Claude Opus 5 在最高推理档位下完成 20×20 位(即两个 20 位数字相乘)乘法测试,1200 道题全部答对,准确率 100%;但这一结果依赖开启最大推理强度(m1、m6)。
- GPT-6-Astra 无法在无 CoT 模式下运行,API 最低推理档位即为 low,而在 low 档其乘法准确率仍达 99.6%(m3)。
- maksymandr 贴出 20 位乘法手算竖式图,直观说明该规模下人类手算几乎必然出错(m2)。
- 实践要点:任何合理的 LLM 在处理超过 5×5 位的乘法时都应调用外部工具,即可 100% 算对(m4)。
观点与推测
- 关于为何新模型 Fable 和 Astra 不提供无思考模式,maksymandr 猜测原因包括:无 CoT 版本会让模型大小与深度信息被推断出来;无 CoT 版本更易受各类攻击;且只有 Fable 能读取 Fable 的隐藏思维链,不希望该通道被绕开(m5)。此为推测,非官方确认。
- scaling01 认为,该评测可用于衡量无 CoT 能力,对循环深度架构尤有意义(m7)。
为什么重要
该评测以一个极简、可复现的任务量化了前沿模型纯推理能力的上限,同时揭示了「无思考模式」在最新一代模型中可能被有意取消的趋势,引发对模型能力披露与安全考量之间权衡的讨论。
2026-09-17 ~ 2026-09-17 · 8 条相关
一手来源
- 实测 Claude Opus 5 纯推理完成 20×20 位乘法,1200 题全对 — maksym_andr ·
- GPT-6-Astra 被曝无法关闭 CoT,最低推理档乘法准确率仍达 99.6% — maksym_andr ·
- 大数乘法不用愁:LLM 调用外部工具即可 100% 算对 — maksym_andr ·
- 【源头】实测 Claude Opus 5 纯推理完成 20×20 位乘法,1200 题全对 — maksym_andr · 2026-09-17
- 【源头】GPT-6-Astra 被曝无法关闭 CoT,最低推理档乘法准确率仍达 99.6% — maksym_andr · 2026-09-17
- 一张图看 20×20 位大数乘法:人类手算几乎必错的规模 — maksym_andr · 2026-09-17
- 【源头】大数乘法不用愁:LLM 调用外部工具即可 100% 算对 — maksym_andr · 2026-09-17
- GPT-5.5 纯推理多格乘法实测 99.46% 准确率,作者提醒实际会调工具 — maksym_andr · 2026-09-17
- 20 位数乘法 Opus 5 全对,作者推测无思考模式另有隐情 — scaling01 · 2026-09-17
- 为何 Fable、Astra 不提供无思考模式:防攻击与保护 CoT 监控 — maksym_andr · 2026-09-17
另有 1 条近重复转述:xeophon