WorkflowEvals 开源:一套类型安全的 Agent 工作流评测集
_lewtun · x · 2026-09-30
typesafe 团队发布了 WorkflowEvals,一套类型安全的 agent 工作流评测资源合集,并附上可复现的 GitHub 仓库与博客,主张「anti-benchmaxxing」的评测方法论。
合集包含多个场景化评测数据集:
- 发票处理(evalsafe-invoice-processing):8.37k 条
- 客服(evalsafe-customer-service):5.33k 条
- 安全事件(evalsafe-security-incidents):4.22k 条
- Agent 轨迹可观测性(evalsafe-agent-trace-observability):2.23k 条
作者同时放出论文/工作流评估材料、复现代码库和配套数据集,目标是让 agent 评测从刷榜单转向真实工作流场景的验证。
「编程与Agent」频道最新
- 预测:agent 时代人类不再写代码画画,编辑器没有未来 — akbirthko · 2026-09-30
- 用 vLLM 响应模板把 DiffusionGemma 变成结构化打分器 — bodonoghue85 · 2026-09-30
- 3500 token 请求几乎全命中缓存:Engram agent 记忆放置实战指南 — dl_weekly · 2026-09-30
- 开发者先用 Sonnet 再用 Opus 做出致敬 Rez 的音乐轨道射击游戏 — AIandDesign · 2026-09-30
- Ramp 演示 Agent 自主采购:用 Codex 经 Stripe MCP 挑酒下单并刷卡支付 — jeff_weinstein · 2026-09-30
- Plenio 0.3 发布:本地 AI 音乐制作系统内置乐谱编辑与 DAW 工作流 — Vivid_Promise1700 · 2026-09-30