IndyDevDan 用 5 个基准给 GPT-6 Astra 与 Fable 5.1 排名
IndyDevDan · youtube · 2026-09-14
YouTube 博主 IndyDevDan 质疑 Artificial Analysis 等综合指数:指数是代理的代理,十个基准压成一个数字后,「你该用哪个模型」这个真正的问题反而被抹掉了。他给出自己的 Top 5 agent 基准并据此排名 GPT-6 Astra、Claude Fable 5.1 和开源权重模型。
他的五个基准及用途:
- Terminal-Bench v4.0:最干净的纯 agentic coding 基准,真实容器与 harness 循环,verifier 校验最终状态。
- APEX Agents:投行、咨询、法律等专家撰写任务,代表软件工程之外的知识工作。
- AutomationBench:600+ 覆盖财务/HR/营销/运维的任务,亮点是要求在不触发 guardrails 的前提下完成目标——开启违规计分后排名会大幅翻转。
- AA-Omniscience:幻觉基准,答对/答错/部分正确/不尝试四档,说「不知道」零惩罚;上游幻觉会污染下游整条 agent 流水线。
- DeepSWE v1.1:短而真实的 prompt 下的长程软件工程。
核心论点:选模型是性能、成本、速度三维问题。同样在 Terminal-Bench v4.0 上分数接近,Astra 每任务成本约低 4 倍,决策完全不同。他还主张扔掉已经饱和的基准(如 AA Long Context Retrieval),只看有方差(variance)的基准——方差才是模型选择的 alpha 所在。
「编程与Agent」频道最新
- 用 Claude Design 指挥 AI 画 UI:还原度高、修改成本低 — dotey · 2026-09-14
- Berkeley 新数据智能体基准:顶级模型仅通过约三分之一任务 — CShorten30 · 2026-09-14
- 用免费DaVinci+AI代理剪视频:30分钟干完过去一周的活 — alexcovo_eth · 2026-09-14
- Motioneer:用 Claude Code 当导演,18 秒产出 Notion 风格影片 — Sea-Assignment6371 · 2026-09-14
- Cranpose:让 AI agent 用 Jetpack Compose 语法写 Rust 跨平台应用 — Secure_Pirate9838 · 2026-09-14
- Anthropic:同样的 60 万 token,会“请教”的 agent 得分 89 vs 76 — AI Engineer · 2026-09-14