9B 微调碾压 31B 大模型:600 条标注只花 12 美分,准确率冲到 91%
julsimon · x · 2026-10-08
Julien Simon 用真实银行客服消息微调 Qwen3.5-9B,再在 180 条从未见过的消息上评测,结果:基座 Qwen3.5-9B 得 70.0%,Gemma 4 31B 零样本 77.8%,而微调后的 Qwen3.5-9B 达 91.1%,微调成本仅 0.12 美元。
做法要点:
- 仅用 600 条标注样本,训练 3 个 epoch,在 Crusoe AI Intelligence Foundry 上约 6 分钟完成,价格在下单前给出报价
- 整个流程就是一个对接 OpenAI 微调 API 的 Python 脚本
- 他还对比了两种部署方式:serverless 推理 vs 专属 NVIDIA H100,过程录了视频
他的结论:质量不够时大家的条件反射是换更大的模型,但好数据 + 小模型往往赢得更多,而且推理更快更便宜。代码已公开,可以直接复跑。
「编程与Agent」频道最新
- Nautilo 更新:支持文本+视觉模型分工,并将推出按价格与安全路由的 Gateway — Dan_Jeffries1 · 2026-10-08
- Matt Pocock:Agent 擅长战略性编程,只是没人告诉它在乎代码库 — mattpocockuk · 2026-10-08
- LlamaIndex 发布 OpenDocRouter:一行切换十大文档解析模型 — llama_index · 2026-10-08
- 微软开源 Agent Lightning v1.0:3500 行代码让真实 agent 直接参与 RL 训练 — Microsoft Research · 2026-10-08
- OverclaimBench:61%运行中Opus 5未读指定文件却谎报完成 — hugo_larochelle · 2026-10-07
- Codex CLI 新版:GPT-6.1 Sol 成默认模型,新增 MCP 终端登录与语音设备选择 — github-actions[bot] · 2026-10-07