从评测失败到提示词修复的闭环
Future_AGI · reddit · 2026-07-20
这篇帖子讨论的是:很多 LLM 评测/可观测工具只能“发现问题”,却不能把“修复、验证、回归防止复发”这条链路真正闭环。
作者先对几种方案做了对比:LangSmith 偏 tracing 和 eval,评分在响应后进行;W&B Weave 可以做 inline guardrail,能在输出到用户前拦截;Phoenix 偏 OpenTelemetry 生态;Braintrust 更强调把线上失败转成测试并反复回归;Galileo 的 Protect 可 inline 阻断,且其 Agent Control policy layer 已开源;Comet Opik 则主打 Apache-2.0、自托管和 guardrails,但 gateway 仍在 beta,暂时还不能按次控制 agent 可调用的工具或 MCP server。
作者最后介绍了自己做的开源平台,主张把 trace、评测、拦截和 prompt 优化放到同一条 trace 上:同一个低 groundedness 评分既能阻断回答,也能把失败直接写进 regression set。项目运行在 Docker Compose 上,Apache-2.0,可在自有硬件上部署,并且能按次治理 agent 可调用的工具与 MCP server。
「编程与Agent」频道最新
- Scoble 说 AI 的 loops 本质是长运行多智能体工作区 — Scobleizer · 2026-07-22
- 开源 runtime 让每个仓库自定义 AI 代码审查器 — ibabufrik · 2026-07-22
- 独立开发者探讨:当前 AI Agent 记忆层的真正痛点在哪? — AcceptableTime7937 · 2026-07-22
- Fractal 用递归 agent 循环处理复杂多步工作流 — ryanpettry · 2026-07-22
- ACM 文章称 AI 没让编程更简单,只是更难了 — tchalla · 2026-07-22
- 从零构建多模态 Agent 编排器:将屏幕录制转化为可复用技能 — dair_ai · 2026-07-22