llama.cpp 新增决策模型:一次前向返回各选项概率,已支持 5 个开源模型
ngxson · x · 2026-10-02
llama.cpp server 通过 /v1/systemone 端点支持「决策模型」(decision models):输入一个状态(文本、JSON 或截图)和带类型的问题,模型在单次前向传播中为每个选项返回概率,而不是逐 token 生成文本再解析。API 兼容 TypeSafe Jev 模型引入的 System One 格式,现有客户端只需换 base URL。
支持的模型(共 5 个开源模型,144M 到 27B):
- Julia-1:144M,基于 mmBERT-small,支持 50+ 语言,单次回答约 3 ms
- Laya:421M,基于 ModernBERT-large,英文,约 5 ms
- Kev-4B / lev:4B,基于 Qwen3.5 系列,约 12/36 ms
- OpenJev:27B,基于 Qwen3.8-27B,支持中英德法印日,可读图,约 43 ms
典型用途包括请求路由、内容审核、校验 agent 步骤是否成功、决定 agent 下一步动作。问题类型分 choice(给选项返回各选项概率)和 score 等。文章给出了快速上手命令(llama serve -hf ggml-org/Kev-4B-GGUF),模型收录于 Hugging Face 的 Decision models 集合,并有社区 Decision Index 供横向比较。
所属事件:llama.cpp 推出决策模型端点,最小 144M 模型仅需 3ms(3 条相关)→
「编程与Agent」频道最新
- 爆料:Gemini 桌面端将获完全访问权限,可操控 Mac 任意应用 — testingcatalog · 2026-10-02
- 用航空维修受控英语写论文?实测发现更适合说明书 — Paimaamu · 2026-10-02
- 用 Statecharts 驯服分布式 Agent:Earendil Pi Durable 的可交互复刻 — sloppenheimer · 2026-10-02
- 微软开源 NVX:基于 OpenVMM 的超轻量微 VM 沙箱,专跑不可信 Agent 负载 — unixterminal · 2026-10-02
- exe.dev:别再堆任务管理面板,请少跑一些 Agent — charles_irl · 2026-10-02
- 开发者搭出多智能体 ML 团队:人类只需审批,token 省 40% — kmeanskaran · 2026-10-02