三周冒出 113 个决策模型:七成基于 Qwen,最便宜的不到一厘钱
jonathanmalkin · reddit · 2026-10-08
作者用 Claude 辅助调研并亲自整理了过去三周爆发的「决策模型」(decision model) 赛道:
- 是什么:输入证据+封闭问题,返回带概率的类型化答案,不写散文。单次决策成本不到一美分的零头,延迟几十到几百毫秒;一次请求可并行携带几十到 200 个问题,但问题之间相互独立、不能链式依赖。
- 赛道格局:TypeSafe 9 月 15 日发布 Jev 开创品类,三周内 Cloudflare、Perplexity、Liquid、Fastino、OpenAI 跟进,HF 榜单已超百项。但「113 个」有水分:112 个开源项中 70 个基于 Qwen、18 个基于 Gemma 4,20 个只是原模型加解码技巧、无新权重。
- 排名:独立 Decision Index 上 Perplexity Decider v1.1 独居第一,Fastino GLiDE、Jev、Torchcast 并列第二;各家的差距更多在校准、价格和部署位置,而非准确率。
- 性能:27B 模型单卡本地推理 0.10–0.14 秒,托管 API 独立实测 0.1–0.6 秒;开源选项 Laya 最弱,各档硬件都有 6–14 倍更强的替代。
- 实用设想:作者提出邮件收件箱方案——脚本轮询过滤、每封邮件只问 4 个事实再套规则,LLM 只处理需要写作的邮件,估算月成本从 $353 降到 $28(尚未实际运行)。
- 另一个细节:Jev 的 /v1/systemone 请求格式已被 Clef、Laya、Kev、SGLang 兼容,换供应商接近改配置。
「模型」频道最新
- 把 GPT、Claude、Grok 塞进真车去买汉堡,只有一家成功了 — nordicinst · 2026-10-08
- 浏览器版 ChatGPT 现降级提示:「能力受限,回复质量可能下降」 — jasondeanlee · 2026-10-08
- Reddit 实测:同额度下 Work 模式比 Codex 模式更能打 — sasik520 · 2026-10-08
- Epoch发布InnovationEval:AI做出重大创新的能力仍远不达标 — Afinetheorem · 2026-10-08
- 用户实测称 Haiku 5.5 是工作流重大升级 — Sorcerer12345 · 2026-10-08
- OpenRouter 上线决策模型排行榜,typesafeai 包揽全部类目第一 — gaganghotra_ · 2026-10-08