模型频繁更新杀死项目:自训路由器达不到新版 GLM 水平

gaviniboom · reddit · 2026-10-03

Reddit 用户 gaviniboom 训练了一个 4B 路由模型,在 DeepSeek v4 Flash 0731 与 GLM 5.2 之间分流请求,本地测试达到了接近 GLM 5.2 的效果,且 token 成本与直接用 OpenRouter 相当,原计划把 DeepSeek 部分卸载到本地服务器。

但 GLM 5.3 发布后,路由方案未能跟上,效果反而不如 GLM 5.3 Flash,项目因此搁置。作者表示代码还在 research-grade 阶段,愿意分享代码或接受调参建议。核心教训:上游模型迭代太快,针对特定模型对训练的路由器很快过时。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →