GPT-5.5 纯推理多格乘法实测 99.46% 准确率,作者提醒实际会调工具

maksym_andr · x · 2026-09-17

maksymandr 引用 cozyblazex 的复现实验:GPT-5.5 在中等推理档位、每格采样 7 次的条件下,多格乘法测试准确率达 99.46%,全程不调用任何工具,纯靠模型自身推理。

作者补充指出,实践中任何合理的 LLM 在超过 5×5 位乘法时都会调用外部工具,因此在 low 推理档下实际准确率可以均匀达到 100%——纯推理评测更多是衡量模型内在能力而非实用场景表现。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →