W&B 演示:把 agent 生产事故转化为评测用例再验证修复
wandb · x · 2026-10-06
W&B 的 Zubin Aysola 在 AI Engineer World's Fair 演讲中演示了一套 agent 质量改进流程:当线上 agent 犯错时,把 ARIA 生产 trace 直接转化为一条 eval 用例,再用它对修复效果做基准验证,让每次事故沉淀为回归测试资产。演讲录像已公开。
「编程与Agent」频道最新
- Twilio 点评 OpenAI DevDay:Dots 是能在对话之间持续工作的 agent — craigsdennis · 2026-10-06
- UCLA 博士用 LLM agent 63 天产出 12.6 万行 Lean 4 机检证明 — siyan_zhao · 2026-10-06
- 开发者试验 Artifacts 标签页:让 agent 产出可视化成果概览 — charlieholtz · 2026-10-06
- 用户晒单:Claude Code Cloud 一个半小时烧掉 107 美元 — MicahBerkley · 2026-10-06
- 开发者实测:Google Docs/Drive 比 Markdown 文件更适合同步 Agent 上下文 — AI_Andrew · 2026-10-06
- Cowork 明日起任务迁移云端执行,Anthropic 工程师详解原因 — lydiahallie · 2026-10-06