GRPO 专家 SLERP 合并:小规模自托管 LLM 扛下一半线上流量
t-tech · hf · 2026-09-02
t-tech 发布工作:基于生产真实请求分布,用 GRPO 分别训练多个专用专家模型,再通过 SLERP 权重合并成一个小规模自托管 LLM。
结果显示,该合并模型在指令遵循、函数调用和内部任务上超过大得多的基线模型,同时以更低成本承载了平台约一半的线上流量,展示了「按自有流量分布做后训练」的可行路线。
「Infra」频道最新
- antirez 力挺 DeepSeek v4 Flash:仍是本地推理之王,现已支持视觉 — antirez · 2026-09-02
- 跑 Qwen3.8 27B Q8 求性价比硬件:Ascend 310 缺货、MI50 争议 — Snoo-2768 · 2026-09-02
- 旧金山举办 AI Infrastructure Night 聚会 — glcst · 2026-09-02
- 谷歌签下 396 兆瓦地热协议,AI 推动探索非常规能源 — VraserX · 2026-09-02
- Local Model Suitability:自动判断本地运行降低成本 — modelcontextprotocol · 2026-09-02
- OpenAI 工程师谈编译器 2.0:AI 作为随机优化器 — MikePFrank · 2026-09-02