从 eval 到 SFT 再到 vLLM 调优,一手复盘为大客户省推理成本
dhruv2038 · x · 2026-09-02
作者分享过去一周为 evohq 大客户部署自定义模型服务的一手经验:
- 先分析客户流量模式,搭建 eval 并对多个模型做大量消融实验
- 发现节省不够,于是做 post-training:先 SFT 再叠加 RL 策略
- 端到端推理优化:按客户数据分布定制 speculative decoding 模型、调 vLLM 配置、量化等
- 还做了算力分配、推理容量规划与按流量画像预热
- 整个流程由团队内部 autoresearch / AI engineer 编排
目前团队正快速接入推理服务商以满足增长需求,并招募月 AI/agent 支出超过 $20k 的客户。
「编程与Agent」频道最新
- 给 AI Agent 独立邮箱很危险:Reddit 热议 Agent 身份架构争议 — Creamy-And-Crowded · 2026-09-02
- Merge 推出团队 AI 治理工具:模型路由+设备端策略管控 — shensi · 2026-09-02
- Weaviate Ask Mode 新增可配置评估步骤,兼顾速度与可验证性 — CShorten30 · 2026-09-02
- 构建 Kimi K3 终极 Agent Harness:模型不再是瓶颈,框架才是 — VibeMarketer_ · 2026-09-02
- 爆料:Google Antigravity CLI 二进制中发现 GLM 5.2 引用 — gaganghotra_ · 2026-09-02
- 设计师一周提交 12 个 PR,AI 正在重塑设计角色边界 — talkaboutdesign · 2026-09-02