评测称 Claude Fable 5.1 将 agent 失败率砍半,单次正确答案成本 2.46 美元
ryanshrout · x · 2026-09-03
Signal65 推出 PINNACLE 榜单两天后,Anthropic 发布了 Claude Fable 5.1,其测试数据恰好印证了该榜单的立意:
- 失败率:agent 工作流失败率从 Opus 5 / GPT-5.6 Sol 的 14/100 降至 7/100,即减少约一半
- 幻觉:在文档无法回答的问题上编造答案的比例为 0.7%,对比 Opus 5 的 7.6%(约每 140 次一次 vs 每 13 次一次)
- 意义:这一差距决定 agent 是「事事需要人工复核」还是「只需复核例外情况」
- 成本:每个正确答案花费 2.46 美元,是 Opus 5 的 1.8 倍,且大头来自 agent 每步重复读取的上下文,账单随用量增长且没有可调节的旋钮
结论:更少的失败 vs 更小的账单,这个按岗位权衡取舍正是 PINNACLE 榜单存在的理由。
「Infra」频道最新
- 博通 CEO:Anthropic 与 OpenAI 大购谷歌 TPU,将成其前两大定制芯片客户 — dinabass · 2026-09-03
- Hock Tan: 电力供应已直接决定算力部署的具体时点 — BenBajarin · 2026-09-03
- Perplexity 开源 Mac 本地推理服务,专为 Qwen 优化 Apple Silicon 性能 — Specter_Origin · 2026-09-03
- GLM-5.3-Flash 本地跑出 1005 tok/s,双卡 RTX PRO 6000 实测 — BanghuaZ · 2026-09-03
- Nvidia 市值占标普 500 约 8%,达美国 GDP 的 16.3% — ivan_bezdomny · 2026-09-03
- 博通 Q3 AI 芯片营收 167 亿美元同比暴涨 221%,Q4 指引 217 亿 — Beth_Kindig · 2026-09-03