GPT-5.5 纯推理多格乘法实测 99.46% 准确率,作者提醒实际会调工具
maksym_andr · x · 2026-09-17
maksymandr 引用 cozyblazex 的复现实验:GPT-5.5 在中等推理档位、每格采样 7 次的条件下,多格乘法测试准确率达 99.46%,全程不调用任何工具,纯靠模型自身推理。
作者补充指出,实践中任何合理的 LLM 在超过 5×5 位乘法时都会调用外部工具,因此在 low 推理档下实际准确率可以均匀达到 100%——纯推理评测更多是衡量模型内在能力而非实用场景表现。
「模型」频道最新
- 研究员筛选合成环境:Qwen 必败而 GLM5.3 能解,发现有趣行为倾向 — kalomaze · 2026-09-17
- 为何 2026 年还留非思考模式?CoT 监控与性能双双要推理 — scaling01 · 2026-09-17
- 开发者自建实时语音模型对比表,六家轮次机制一查便知 — mahimairaja · 2026-09-17
- Karayev 实测 GPT-6 Astra High 一次性实现完整 GitLab — sergeykarayev · 2026-09-17
- Claude 降低订阅配额、Codex 取消 20 倍档,厂商用量齐收紧引「Aipocalypse」 — ThePeterMick · 2026-09-17
- Baseten 推开源模型安全基础设施,联合 Hugging Face 与 Goodfire — baseten · 2026-09-17