348M 小模型刷爆 GPT-3 算术:9 项测试平均 99.4%
nkthebass · reddit · 2026-09-10
Reddit 用户从零训练了一个 348M 参数、22.7B tokens 的小模型,专门做逐步演算的算术(竖式加法带进位、借位链、部分积乘法),在 GPT-3 的九个算术子任务上平均达到 99.4%,远超 GPT-3 175B 的直接回答(如 5 位数加法 GPT-3 仅 9.3%,该模型 100%)。
最有趣的发现:模型只能处理到 8 位数的瓶颈不在算术而在词表——训练数据只命名了 6 个数位,9 位数时模型"没有名字可用"就跳过该列,得出少一位的答案(每一列计算其实全对)。把数位名列表从 6 项扩到 19 项,干净处理的上限就从 8 位提升到 14 位。
其他结果:
- 3×3 乘法 98%,负数结果 85%(弱点是数值比较而非算术)
- 95.3% 的样本演算过程有效且答案正确,"过程对答案错"仅 0.7%,推理链高度可靠
- 短板是应用题:GSM8K 仅 4%,ASDiv 16.5%,失败模式是运算选择而非算术本身
「模型」频道最新
- 年付 2 万欧客户控诉 Claude 变弱,疑 Anthropic 后台省算力 — maier_ak · 2026-09-10
- Meta 超级智能实验室总监回应质疑:Muse 好到黑不动 — alexandr_wang · 2026-09-10
- 用户称年付 2 万欧元用 Claude,却感觉模型越来越弱 — maier_ak · 2026-09-10
- AI 助手 Astra 说话常漏空格?用户:多发生在数字场景 — gandamu_ml · 2026-09-10
- 旅行途中用 Claude Code 遭遇:权限乱改、过早压缩会话 — maier_ak · 2026-09-10
- DeepSeek V4.1 Flash 流出可开启视觉输入,官方版仍未发布 — teortaxesTex · 2026-09-10