模型频繁更新杀死项目:自训路由器达不到新版 GLM 水平
gaviniboom · reddit · 2026-10-03
Reddit 用户 gaviniboom 训练了一个 4B 路由模型,在 DeepSeek v4 Flash 0731 与 GLM 5.2 之间分流请求,本地测试达到了接近 GLM 5.2 的效果,且 token 成本与直接用 OpenRouter 相当,原计划把 DeepSeek 部分卸载到本地服务器。
但 GLM 5.3 发布后,路由方案未能跟上,效果反而不如 GLM 5.3 Flash,项目因此搁置。作者表示代码还在 research-grade 阶段,愿意分享代码或接受调参建议。核心教训:上游模型迭代太快,针对特定模型对训练的路由器很快过时。
「编程与Agent」频道最新
- 用户让 Muse agent 首个任务:向小额法庭递交诉讼 — Scobleizer · 2026-10-03
- 四大 AI Agent 横评:Grok Bot、Muse、Dot、Hermes 各自适用场景 — HarperSCarroll · 2026-10-03
- 斯坦福 CS224V 智能体课程公开:自底向上构建反幻觉知识栈 — stanfordnlp · 2026-10-03
- 独立开发者用 Claude 一周做出飞艇版 FTL 游戏,含 7 语言和 100 个成就 — MosskeepForest · 2026-10-03
- Cloudflare 决策模型 Clef 上架 Ollama,可分类图片与工单路由 — ollama · 2026-10-03
- OpenDots 上线 GitHub 首日获 1.5k Star,可克隆二改 — aigclink · 2026-10-03