1565 封邮件实测:Perplexity 与 Cloudflare 决策模型比拼

michellechen · x · 2026-10-02

Perplexity 和 Cloudflare 昨天发布了新的决策模型,作者用此前评测 Jev 时同一批 1565 封商务邮件跑了横向对比:6260 次调用、10 个分类、4 个模型。最便宜的模型(Clef-flash)反而最准,每处理 1000 封邮件仅约 $0.06。最有趣的发现是 Clef 的实际准确率远高于其置信分:在约 75% 置信度时,实际正确率达 98%。完整基准数据已公开。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →