550 条样本训练 15 分钟,小模型本地推理 0.06 秒替代 Gemini
newz2000 · reddit · 2026-09-26
一位开发者分享了他首次训练小型语言模型的完整过程,用一个 50MB 的小模型替代云端 API:
背景:他的内部工具用 Gemini Flash(最低思考预算)做判断类任务,约 0.9-1.2 秒。但用户在 App 里操作极快,连 0.9 秒的延迟都影响体验。
做法:
- 原 prompt 是判断字符串 b 是否以某种方式关联字符串 a,输出布尔值
- 确定性 Python/JS 代码准确率仅 66%,Gemini Flash 达 99%
- 收集约 550 条真实用例,再用两个前沿模型仿造扩展到约 2500 条训练数据
- 在 RTX A6000 16GB 上仅训练 15 分钟
结果:50MB 小模型本地 CPU(老 Threadripper)推理仅 0.06 秒,准确率 97%——在这个场景下 99% 与 97% 的差距完全可以接受。他计划部署到服务端并持续记录准确率以补充训练,还考虑浏览器端推理。
「编程与Agent」频道最新
- 想在 Codex 桌面版用 Opus 当主 agent?作者陷入工具两难 — kevinkern · 2026-09-26
- 「编程而非提示」:斯坦福 DSPy 用签名和优化器自动调 prompt — stanfordnlp · 2026-09-26
- Workato 推出 Otto:接 1400+ 应用的企业级 AI 队友 — adamse · 2026-09-26
- 作者给 LLM 一万美元实操股票组合,十天全程自动决策 — demian_ai · 2026-09-26
- astra 搭多节点 RL 训练好到离谱,网友调侃像是专门训练过 — alex_peys · 2026-09-26
- DuckDB-Wasm 借 OPFS 实现浏览器持久化,含版本踩坑指南 — JeremyCMorgan · 2026-09-26