评测称 Fable 5.1 失败率减半:每百次仅 7 次失败、幻觉率 0.7%
ryanshrout · x · 2026-09-03
- Patrick Moorhead 转发 PINNACLE 基准的 agentic 成本效益评测:Fable 5.1 在成本 1.8 倍的情况下完成任务量多 3.6 倍,失败数减半。
- 引用分析指出,阻碍 AI agent 进生产的不是智能而是失败率:Claude Opus 5 与 GPT-5.6 Sol 每 100 个工作流失败约 14 次,迫使企业全程人工监督。
- Fable 5.1 在其测试中把失败降到每 100 次约 7 次,对文档无法回答的问题编造答案的比例为 0.7%,远低于 Opus 5 的 7.6%。
- 结论:失败率减半、幻觉率降一个数量级,意味着 agent 从「每单都要人审」变为「只审例外」——代价是账单更贵。
所属事件:PINNACLE 评测:Claude Fable 5.1 agent 失败率减半(2 条相关)→
「模型」频道最新
- 传 OpenAI 在 Astra 中使用 neuralese 循环变换器,新的 scaling 轴浮出水面 — imadade · 2026-09-03
- XBOW 团队拿下今年首个 Chrome 全链漏洞利用奖励 — moyix · 2026-09-03
- Gemini 3.8 Flash 的 Pareto 最优地位仅维持了 5 小时 18 分钟 — alejandroll10 · 2026-09-03
- 双 DGX Spark 实测:GLM-5.3-Flash 写作与视觉胜过 DeepSeek-V4-Flash — kuhunaxeyive · 2026-09-03
- Anthropic 商务智能体只建购物车交人工结账,被赞退款风控思路对 — HaktanSuren · 2026-09-03
- Qwen3.8 27B Q8 翻车:12 万 token 后发现根本没读计划,自行实现别的功能 — KingCpzombie · 2026-09-03