TypeSafe 发布 Workflow Evals:把策略拆成工作流,各模型比 prompt 更准更快更省

multiply_matrix · x · 2026-09-30

评测平台 TypeSafe 上线近两周后,应请求整理开放其评测数据集,同时重申反公开榜单立场:将逐步废弃所有用于评测的数据集(无论内部还是公开)。

核心方法论

横评结果(各模型用厂商默认推理设置):准确率-成本、准确率-时间散点显示,没有任何前沿模型同时做到更便宜且更准、或更快且更准,各有所长。该项目强调「假定 harness 正确」,聚焦测模型而非争论标注。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →