llama.cpp 新增决策模型端点,单次前向给出选项概率
ggerganov · x · 2026-10-02
llama.cpp 服务器新增 /v1/systemone 端点,支持「决策模型」(Decision Models):发送一段状态(文本、JSON 或截图)加若干带类型的问题,模型在单次前向中为每个选项返回概率,而非逐 token 生成文本再解析。接口遵循 TypeSafe Jev 模型引入的 System One 格式,现有客户端只需改 base URL,实现见 PR #29818。
典型用途:请求路由、内容审核、校验 agent 某步是否成功、选择 agent 下一步动作。
首批支持模型(单卡 RTX PRO 6000 上单问题中位延迟):
- Julia-1:144M,基于 mmBERT-small,支持 50+ 语言,Apache 2.0,约 3ms
- Laya:421M,基于 ModernBERT-large,英文,Apache 2.0,约 5ms
- Kev-4B:4B,基于 Qwen3.5-4B-Base,英文,Apache 2.0,约 12ms
- lev:4B,基于 Qwen3.5-4B,英文,Apache 2.0,约 36ms
- OpenJev:27B,基于 Qwen3.8-27B,支持英德法印地中日,含图像,CC BY-NC 4.0,约 43ms
快速上手:llama serve -hf ggml-org/Kev-4B-GGUF。请求包含状态与问题,问题类型有 choice(返回最优选项及各选项概率)、score 等。模型可在 Hugging Face 的 Decision models 集合中找到,社区还维护了对比用的 Decision Index,后续会有更多模型加入。
所属事件:llama.cpp 推出决策模型端点,最小 144M 模型仅需 3ms(3 条相关)→
「编程与Agent」频道最新
- 爆料:Gemini 桌面端将获完全访问权限,可操控 Mac 任意应用 — testingcatalog · 2026-10-02
- 用航空维修受控英语写论文?实测发现更适合说明书 — Paimaamu · 2026-10-02
- 用 Statecharts 驯服分布式 Agent:Earendil Pi Durable 的可交互复刻 — sloppenheimer · 2026-10-02
- 微软开源 NVX:基于 OpenVMM 的超轻量微 VM 沙箱,专跑不可信 Agent 负载 — unixterminal · 2026-10-02
- exe.dev:别再堆任务管理面板,请少跑一些 Agent — charles_irl · 2026-10-02
- 开发者搭出多智能体 ML 团队:人类只需审批,token 省 40% — kmeanskaran · 2026-10-02