1565 封邮件实测:Perplexity 与 Cloudflare 决策模型比拼
michellechen · x · 2026-10-02
Perplexity 和 Cloudflare 昨天发布了新的决策模型,作者用此前评测 Jev 时同一批 1565 封商务邮件跑了横向对比:6260 次调用、10 个分类、4 个模型。最便宜的模型(Clef-flash)反而最准,每处理 1000 封邮件仅约 $0.06。最有趣的发现是 Clef 的实际准确率远高于其置信分:在约 75% 置信度时,实际正确率达 98%。完整基准数据已公开。
「编程与Agent」频道最新
- 先访谈 5 问再写码:滚动网页生成的结构化 Prompt 模板 — aziz4ai · 2026-10-02
- 一条提示词工作流:用 Claude 生成 GSAP 滚动动画单文件网页 — aziz4ai · 2026-10-02
- 让agent改代码后怎么办?求客户定制代码的维护部署方案 — Embarrassed-Survey61 · 2026-10-02
- Cloudflare 推出 AI Gateway Web Search API,统一接入三家搜索商 — michellechen · 2026-10-02
- 20任务×3重复=120次运行:harness对比评测的隐形成本 — RelationshipRound711 · 2026-10-02
- 蚂蚁内部Tiger Agent曝光:Ling-3.1-flash跨浏览器终端规划办公工作流 — tinkerbellyie · 2026-10-02