TypeSafe 发布 Workflow Evals:把策略拆成工作流,各模型比 prompt 更准更快更省
multiply_matrix · x · 2026-09-30
评测平台 TypeSafe 上线近两周后,应请求整理开放其评测数据集,同时重申反公开榜单立场:将逐步废弃所有用于评测的数据集(无论内部还是公开)。
核心方法论
- 不让模型一次性解决整个问题,而是把业务策略拆解为程序化规则 + 智能判断:Noul(是/否)、Choice(单选)、Score(分级)三类问题,再由代码汇总产出动作
- 以报销审批为例:每条策略句子变成一个带类型的模型问题或一条代码规则
- 结论:在四个示例任务上平均,所有模型以工作流方式执行,都比同策略写成单个 prompt 更准确、更便宜、更快
横评结果(各模型用厂商默认推理设置):准确率-成本、准确率-时间散点显示,没有任何前沿模型同时做到更便宜且更准、或更快且更准,各有所长。该项目强调「假定 harness 正确」,聚焦测模型而非争论标注。
「编程与Agent」频道最新
- Elvis 现场解读:Codex agent 与 harness 决定模型优化方向 — omarsar0 · 2026-09-30
- Swarms 团队重启 Rust 多 Agent 编排框架 swarms-rs — KyeGomezB · 2026-09-30
- Codex CLI 更新细节:/usage 用量分析、Mermaid/LaTeX 终端直接渲染 — OpenAIDevs · 2026-09-30
- OpenAI 重磅更新 Codex CLI:全屏新界面,支持并行管理多个智能体 — OpenAIDevs · 2026-09-30
- 曾公开拒绝 MCP 的 Pi 编程工具将其纳入核心架构 — omarsar0 · 2026-09-30
- 睡前下一个 prompt,AI Agent 通宵提交一堆性能优化 PR — samgoodwin89 · 2026-09-30