W&B 为 Weave 增加更强的 agent 追踪和自动评测
_ScottCondron · x · 2026-07-23
W&B 在 Weave 里继续强化 agent 观测和评估
这条帖子说,W&B 正在继续打磨 agent tracking 的体验,而且已经看到越来越多团队把它用于 自动研究、生产 agent 和训练中的 rollout。
主要更新
- 团队已经全面采用 GenAI OTEL 作为标准
- 增加了和常见 harness 的集成
- agent trace 现在更像人类可读的调试界面,消息和 tool call 会以 markdown 风格展示
- 还在做更多 trace 和 eval 相关能力,例如:
- 让生产环境里的 LLM judge 自动标记问题
- 内置一个 agent 去查询 trace 并帮助定位根因
- 在海量 trace 之间更快跳转、筛选和排查
作者的判断是:agent observability 这块还远没有定型,W&B 想把开发工具层做成自己的优势区。
「编程与Agent」频道最新
- Baseten 称正与 Harvey 合作打磨长时运行 agent — baseten · 2026-07-23
- 微软开源 MagenticLite 全栈,含 MagenticBrain 和 Fara 1.5 — SaleemaAmershi · 2026-07-23
- 线程称 GPT-5.6 Sol 五天解出 6 个 Erdős 开放题 — jxnlco · 2026-07-23
- Gary Marcus 称 Claude Code 用了 50 多种工具 — GaryMarcus · 2026-07-23
- 上线 AI Agent 前先回答的 7 个问题 — kashifmanzoor · 2026-07-23
- 用代理网关阻断智能体工具调用死循环 — bulleykebaal · 2026-07-23