1565 封邮件实测 OpenAI Decisions API:Perplexity v1.1 综合最优
denisyarats · x · 2026-10-08
开发者用同一套 1565 封邮件的分诊基准,测试了 OpenAI 新发布的 Decisions API,参测模型横跨 4 家公司共 6 个。
- 综合最佳:Perplexity v1.1 表现最好;OpenAI 是速度最快的,官方称 Decisions API 比 GPT-6 Luna 走 Responses API 快最多 10 倍
- 置信度行为最有看点:Jev 是唯一数百次给出 ≥99% 置信且零翻车的模型;Clef 则严重「低估自己」,实际能力远超其置信度
- Perplexity 四天大变:v1 只有 3 次给出 ≥99% 置信答案,四天后的 v1.1 达 323 次,准确率还略有提升、价格砍半
作者认为 OpenAI 开放 Decisions API 后,这类「让应用近实时选模型/工具/动作」的赛道正式进入混战。
「编程与Agent」频道最新
- 自制 Guitar Mocap 工具:读取 Guitar Pro 谱修复动捕手指穿模 — TinfoilTricorn · 2026-10-08
- Ramp 藏在 AI 可读文件里的隐藏优惠被用户挖出 — gaganghotra_ · 2026-10-08
- 把旧 Notion 课程喂给 Codex,秒变可交互课程 — RichardsonDx · 2026-10-08
- Gary Bernhardt:「AI 工厂」正在重演十年前微服务过度工程的老路 — sergeykarayev · 2026-10-08
- 研究者提出:长程任务进展有赖分层 RL 混合快慢折扣率 — jessi_cata · 2026-10-08
- 本地 MCP 记忆服务 Graph-MIND 发布:LongMemEval 达 88.8% 且写入零 LLM 调用 — BrilliantGrocery8233 · 2026-10-08