从评测失败到提示词修复的闭环
Future_AGI · reddit · 2026-07-20
这篇帖子讨论的是:很多 LLM 评测/可观测工具只能“发现问题”,却不能把“修复、验证、回归防止复发”这条链路真正闭环。
作者先对几种方案做了对比:LangSmith 偏 tracing 和 eval,评分在响应后进行;W&B Weave 可以做 inline guardrail,能在输出到用户前拦截;Phoenix 偏 OpenTelemetry 生态;Braintrust 更强调把线上失败转成测试并反复回归;Galileo 的 Protect 可 inline 阻断,且其 Agent Control policy layer 已开源;Comet Opik 则主打 Apache-2.0、自托管和 guardrails,但 gateway 仍在 beta,暂时还不能按次控制 agent 可调用的工具或 MCP server。
作者最后介绍了自己做的开源平台,主张把 trace、评测、拦截和 prompt 优化放到同一条 trace 上:同一个低 groundedness 评分既能阻断回答,也能把失败直接写进 regression set。项目运行在 Docker Compose 上,Apache-2.0,可在自有硬件上部署,并且能按次治理 agent 可调用的工具与 MCP server。
「编程与Agent」频道最新
- Warp 六个非工程团队全用 Linear 和 Claude Code 工程化运作 — mon__lim · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- Anthropic 研究员:99% 工程师已跑 300+ 自改进 agent 群 — AlishaOutridge · 2026-09-11
- Gergely Orosz 观察:AI Agent 提速十倍交付,却带来一堆小退化 — ducha_aiki · 2026-09-11
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11