GRPO 专家 SLERP 合并:小规模自托管 LLM 扛下一半线上流量

t-tech · hf · 2026-09-02

t-tech 发布工作:基于生产真实请求分布,用 GRPO 分别训练多个专用专家模型,再通过 SLERP 权重合并成一个小规模自托管 LLM。

结果显示,该合并模型在指令遵循、函数调用和内部任务上超过大得多的基线模型,同时以更低成本承载了平台约一半的线上流量,展示了「按自有流量分布做后训练」的可行路线。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →