智能指数 v4.3 更新:Claude Fable 5.1 等三模型刷新性价比前沿
ArtificialAnlys · x · 2026-09-10
Artificial Analysis 称上周「智能指数 vs 成本」帕累托前沿显著外移,Claude Fable 5.1、Muse Spark 1.3 和 GPT-6 Astra 各自在单位成本的高效智能上创下新点。同步发布的 Intelligence Index v4.3 用 AutomationBench-AA 替换了 τ³-Banking,并将 Terminal-Bench 升级到 v4.0;站点还新增了搜索 API 供应商对比(Search Index)、自定义基准工具 Optima 与模型推荐器。近期评测还包括 MiniCPM5-2B、K2 Horizon 375B A23B,以及 Google 四个月内发布的第四款 Flash 模型 Gemini 3.8 Flash;Meta 的 Muse Spark 1.3 被评触及前沿水平。
「模型」频道最新
- Codex CLI 0.154.0 发布:GPT-6-Astra 上线模型选择器与 worktree 支持 — github-actions[bot] · 2026-09-10
- 曝 OpenAI 新模型 8 月 28 日开训,仅一周超越自家最强 GPT-6-Astra — alexcovo_eth · 2026-09-10
- Qwen3.8-2.4T-A95B 开放权重上架 AWS,8×B300 单节点可跑 — AWS ML Blog · 2026-09-10
- 用户吐槽 Astra $200 订阅不够用:多项目几天就烧光额度 — CtrlAltDwayne · 2026-09-10
- OpenAI 发布 GPT-6 Astra,ChatGPT Work 可直接操作桌面应用 — OpenAI · 2026-09-10
- Arena 数据:Claude Fable 5.1 砍掉 58% 附和开场,破折号减少 32% — rohanpaul_ai · 2026-09-10