从评测失败到提示词修复的闭环

Future_AGI · reddit · 2026-07-20

这篇帖子讨论的是:很多 LLM 评测/可观测工具只能“发现问题”,却不能把“修复、验证、回归防止复发”这条链路真正闭环。

作者先对几种方案做了对比:LangSmith 偏 tracing 和 eval,评分在响应后进行;W&B Weave 可以做 inline guardrail,能在输出到用户前拦截;Phoenix 偏 OpenTelemetry 生态;Braintrust 更强调把线上失败转成测试并反复回归;Galileo 的 Protect 可 inline 阻断,且其 Agent Control policy layer 已开源;Comet Opik 则主打 Apache-2.0、自托管和 guardrails,但 gateway 仍在 beta,暂时还不能按次控制 agent 可调用的工具或 MCP server。

作者最后介绍了自己做的开源平台,主张把 trace、评测、拦截和 prompt 优化放到同一条 trace 上:同一个低 groundedness 评分既能阻断回答,也能把失败直接写进 regression set。项目运行在 Docker Compose 上,Apache-2.0,可在自有硬件上部署,并且能按次治理 agent 可调用的工具与 MCP server。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →