12 个真实多应用智能体任务中,Fable 5 与 Kimi K3 同为 7/12

Nearby_Pair_6483 · reddit · 2026-07-28

在真实账号里跑了 12 个跨应用智能体任务,覆盖 Gmail、Slack、Sheets、Salesforce、HubSpot、GitHub 和 Linear,比较了 Fable 5、Kimi K3、GPT-5.6 Sol。

结论是:如果只是普通 SaaS 工具调用,性价比可能更重要;但凡涉及跨应用精确状态写回,三者都不适合无监督直跑,仍然需要 verifier + retry loop。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →