WolfBench:重新定义智能体评测的五维指标
morgymcg · x · 2026-08-10
WolfBench 提出了一套全新的 AI 智能体评测框架,认为单一的平均分不足以反映模型的真实能力。
该榜单基于 Terminal-Bench 2.0,引入了五个维度的指标来展示性能分布:
- Ceiling(上限):历史曾解决过的任务比例。
- Best-of(峰值):单次最佳运行得分。
- Average(均值):平均得分。
- Worst-of(下限):单次最低运行得分。
- Solid(稳健性):每次都能稳定解决的任务比例。
榜单收录了包括 GPT-5.6、Claude Opus 4.7、Gemini 3.5 等前沿模型在多种测试环境下的表现。
所属事件:WolfBench 提出五维指标重新定义智能体评测(2 条相关)→
「编程与Agent」频道最新
- Meta 编程智能体亏本定价:以极低价格换取训练数据 — shashib · 2026-08-10
- Cursor 与 Together AI 合作:打造低延迟 AI 编程推理底座 — togethercompute · 2026-08-10
- shadcn 推出 AI 提示词暂存工具 Copper — shadcn · 2026-08-10
- 实测用 Codex 审查合同条款,每年省下 6000 美元电费 — SIGKITTEN · 2026-08-10
- 百行代码搞定多 Agent 编排:从 demo 玩具到实用工具 — Positive-Ad3618 · 2026-08-10
- 实战:用多智能体框架编排 AI 音乐制作工作流 — jiayuan_jy · 2026-08-10