Shopify 分享 LLM 生产环境持续优化飞轮方法论

MParakhin · x · 2026-09-01

Shopify 在 ICML 2026 上分享了其“模型优化飞轮”方法论,旨在将前沿 LLM 的行为转化为更快、更便宜且持续改进的生产系统。该飞轮始于基于人工标注数据的 LLM-as-judge 评估,用于提示优化、蒸馏和生产回归。利用 Tangle 实验工作流,优化系统提示,从 A/B 流量中收集数据,并通过 SFT、策略内蒸馏和 GRPO 技术蒸馏小模型。这些模型能以更低成本复现甚至超越前沿模型行为。部署后,通过采样低分对话并用强推理模型“修复”来闭环训练。该流程降低了服务成本和延迟,同时提高了生产质量。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →