Hugo Bowne 推出免费 30 分钟闪电课:AI Agent Evals 怎么测
hugobowne · x · 2026-09-20
Hugo Bowne-Anderson 宣布开设免费的 30 分钟 Lightning Lesson「AI Agent Evals: Test What Matters for Your Agent」,延续其与 Hamel Husain、Maxime Beauchemin 等人在 Vanishing Gradients 博客上关于 agent 评测的讨论。
课程将覆盖:
- 如何把任务和失败案例转化为评测,何时用代码检查、LLM judge 或人工审核
- 评测编码、研究、对话、computer-use 等 agent 类型时的差异
- 如何用 traces 和评测结果决定 harness 该改什么,并验证改动是否有效
时间:9 月 21 日 3pm 太平洋时间 / 9 月 22 日 8am 悉尼时间,可注册参加直播或获取回放。
「编程与Agent」频道最新
- 开源工具 jevcache:模型决策结果缓存,重复调用零成本零延迟 — JiliJeanlouis · 2026-09-20
- 开发者吐槽:各家 Agent 框架至今没有内置预算控制机制 — arthurcolle · 2026-09-20
- 实测 jev 上真实浏览器任务秒翻车,演示页面疑为定制沙盒 — TheZachMueller · 2026-09-20
- Cursor 联动 Jira:让 AI 编码助手替你对接工单流 — davidhoang · 2026-09-20
- 用 GPT-6 Astra 把 Godot 概念迁移到 Unreal,改树木光照一气呵成 — OpenAIDevs · 2026-09-20
- Vibecoded 统计软件对比基准:自称「slop」但精度胜出 — Sauers_ · 2026-09-20