550 条样本训练 15 分钟,小模型本地推理 0.06 秒替代 Gemini

newz2000 · reddit · 2026-09-26

一位开发者分享了他首次训练小型语言模型的完整过程,用一个 50MB 的小模型替代云端 API:

背景:他的内部工具用 Gemini Flash(最低思考预算)做判断类任务,约 0.9-1.2 秒。但用户在 App 里操作极快,连 0.9 秒的延迟都影响体验。

做法:

结果:50MB 小模型本地 CPU(老 Threadripper)推理仅 0.06 秒,准确率 97%——在这个场景下 99% 与 97% 的差距完全可以接受。他计划部署到服务端并持续记录准确率以补充训练,还考虑浏览器端推理。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →