1700万参数小模型微调后八成场景胜过通用大模型
max_paperclips · x · 2026-09-27
MaximeRivest 分享了一组实验结论:一个仅 1700 万参数的 Ettin 模型,用大模型生成合成数据微调后,80% 的情况下可击败 Jev,40% 的情况下在人工标注数据上可击败 Kimi-k3;用 Kimi-k3 合成数据蒸馏后约 70% 情况可接近 Jev 水平。
关键数据:
- 合成数据生成耗时 8 秒7 分钟,成本 0.7730 美元
- 在 3090 GPU 上微调仅需 45 秒3 分钟,CPU 上 1040 分钟,甚至在三星 S21 手机 GPU 上也能跑(20 分钟3 小时)
- 当训练数据覆盖不了测试/生产数据分布时,通用大模型仍可能更好
结论:如果你有超过 50 万条输入需要分类,在合成数据上微调小模型会比直接用通用大模型更快、更便宜。
「模型」频道最新
- Opus 5.5 展现精确空间感知,VLA 路线获里程碑但触觉仍是短板 — bookwormengr · 2026-09-27
- 开发者吐槽:Gemini 始终没像 Google 一样「成为文化」 — signulll · 2026-09-27
- Grok 推出金融集成:可绑定银行卡与投资账户管理财务 — NicoVerderosa · 2026-09-27
- Factory AI CEO:一年内 90% token 将流向开源模型 — matanSF · 2026-09-27
- banteg 观察到 Opus 5.5 代码审查后 astra 每次都查不出问题 — banteg · 2026-09-27
- 用户实测:Opus 5.5 效率惊人,配额消耗远低于其他前沿模型 — signulll · 2026-09-27