模型升级后 prompt 静默劣化?生产环境 eval 实践讨论

SnooDoubts4271 · reddit · 2026-09-15

一位在生产环境跑 agent 的开发者提出痛点:现有 CI 只检查 prompt 模板的结构合法性(schema、变量、必须失败的坏例),无法发现模板在新模型上“仍通过但输出质量悄悄变差”的问题。

他倾向的方案:

帖子同时向社区征集经验:是按 prompt 逐条评估还是评估整个 agent 运行?自由文本输出如何打分才能避免 LLM judge 漂移?是每次模型更新就重跑 eval 还是定时重跑?

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →