Perplexity Decider 登顶 DecisionBench:93.9% 准确率、534ms、成本最低
AravSrinivas · x · 2026-10-09
DecisionBench(一个用真实记录构造的小模型「有界决策」开源基准,覆盖工程、agent、客服、金融、法律等场景,公开准确率/延迟/成本并可复现)公布新结果:Perplexity 的 Decider V1.1 排名第一且成本最低。
在 949 个共享文本用例上,Decider V1.1 达到 93.9% 准确率、中位延迟 534ms、每千次决策成本仅 $0.016。Perplexity CEO Arav Srinivas 转发了该结果,基准方表示将在自家产品中采用。
所属事件:Perplexity 开源决策模型 v1.1,连登两大决策基准榜首(16 条相关)→
「模型」频道最新
- LightOnOCR-2 开源:0.8B 小模型反超更大对手 — IgorCarron · 2026-10-09
- MathArena 实测:4 个 agent 花费 500 美元写博客,仅 Opus-5.5 达标 — ChrSzegedy · 2026-10-09
- Goodfire 为 Kimi K3 与 GLM 5.3 打造安全监控器:快 50 倍且便宜 50 倍 — CatAstro_Piyush · 2026-10-09
- Anthropic 更新条款:极端情况下禁止持续辱骂模型 — Angaisb_ · 2026-10-09
- 开发者吐槽:模型在代码复用上依然表现糟糕 — snowclipsed · 2026-10-09
- altryne 直播连线 Liquid AI 的 Maxime Labonne 聊开源决策模型 d1 — altryne · 2026-10-09