IndyDevDan 用 5 个基准给 GPT-6 Astra 与 Fable 5.1 排名

IndyDevDan · youtube · 2026-09-14

YouTube 博主 IndyDevDan 质疑 Artificial Analysis 等综合指数:指数是代理的代理,十个基准压成一个数字后,「你该用哪个模型」这个真正的问题反而被抹掉了。他给出自己的 Top 5 agent 基准并据此排名 GPT-6 Astra、Claude Fable 5.1 和开源权重模型。

他的五个基准及用途:

核心论点:选模型是性能、成本、速度三维问题。同样在 Terminal-Bench v4.0 上分数接近,Astra 每任务成本约低 4 倍,决策完全不同。他还主张扔掉已经饱和的基准(如 AA Long Context Retrieval),只看有方差(variance)的基准——方差才是模型选择的 alpha 所在。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →