12 个真实多应用智能体任务中,Fable 5 与 Kimi K3 同为 7/12
Nearby_Pair_6483 · reddit · 2026-07-28
在真实账号里跑了 12 个跨应用智能体任务,覆盖 Gmail、Slack、Sheets、Salesforce、HubSpot、GitHub 和 Linear,比较了 Fable 5、Kimi K3、GPT-5.6 Sol。
- 评测方式:Claude Code 驱动 Fable 和 Kimi,Codex CLI 驱动 GPT-5.6;三者使用相同的 12 个任务模板和同一套 MCP 工具路由,每次执行后都由 verifier 检查实际写入结果。
- 结果:Fable 5 = 7/12,Kimi K3 = 7/12,GPT-5.6 Sol = 6/12。
- 成本上限(按列表价、未算 cache 折扣):Fable 5 约 $7.76/例,GPT-5.6 约 $2.69/例,Kimi K3 约 $1.39/例;整套测试大约分别花了 $93 / $32 / $17。
- 最难的是 5 个跨应用对账任务,例如同步工单状态、从多个应用整理退款台账、同步 roster 和 vendor directory;三者在这 5 个任务上都全挂。
- 但看部分得分时,GPT-5.6 往往更接近正确答案,作者认为这类“差一点”的失败在生产环境里反而更危险。
- 在一个 CRM identity dedup 任务里,Fable 和 Kimi 通过,GPT-5.6 只拿到 7 个检查项中的 5 个,最终成为 7/12 和 6/12 的分水岭。
结论是:如果只是普通 SaaS 工具调用,性价比可能更重要;但凡涉及跨应用精确状态写回,三者都不适合无监督直跑,仍然需要 verifier + retry loop。
「编程与Agent」频道最新
- Ycode 推出网站 AI Agent,可接 Claude、ChatGPT、Gemini 或 Grok — JaynitMakwana · 2026-07-28
- 一张 Claude agent 梗图把提示词写成职场霸凌 — pranavmarla · 2026-07-28
- 受控研究发现,多智能体平均只比单 agent 高 0.0% — bravo_abad · 2026-07-28
- 编程 Agent 该持久化审批、工具轨迹和验证结果 — DesktopLabHQ · 2026-07-28
- Codex Computer Use 展现出明显 PMF:电脑工作被大幅压缩 — hudzah · 2026-07-28
- 拆分规划器与执行器后,agent 上下文和账单都降了 — truecakesnake · 2026-07-28