llama.cpp 支持决策模型:单次前向打分,最小 144M 仅需 3ms
ggerganov · x · 2026-10-02
llama.cpp 新增对「决策模型」(Decision Models)的支持,通过 /v1/systemone 端点提供,遵循 TypeSafe Jev 模型引入的 System One 格式,现有客户端只需换 base URL 即可接入。
与聊天模型逐 token 生成不同,决策模型读取输入状态(文本、JSON、截图)一次,直接为你给出的选项打概率分,单次前向即出结果。典型用途包括请求路由、内容审核、agent 步骤校验和下一步动作选择。
目前已支持的模型:
- Julia-1(144M,基于 mmBERT-small,50+ 语言,Apache 2.0,单次问答中位 3ms)
- Laya(421M,ModernBERT-large,英文,5ms)
- Kev-4B(4B,Qwen3.5-4B-Base,12ms)
- lev(4B,Qwen3.5-4B,36ms)
- OpenJev(27B,支持中英日德法印地语、支持图像输入,CC BY-NC 4.0,43ms)
实测速度基于单张 NVIDIA RTX PRO 6000。请求支持 choice、score 等问题类型。快速上手:llama serve -hf ggml-org/Kev-4B-GGUF。
所属事件:llama.cpp 推出决策模型端点,最小 144M 模型仅需 3ms(3 条相关)→
「编程与Agent」频道最新
- 爆料:Gemini 桌面端将获完全访问权限,可操控 Mac 任意应用 — testingcatalog · 2026-10-02
- 用航空维修受控英语写论文?实测发现更适合说明书 — Paimaamu · 2026-10-02
- 用 Statecharts 驯服分布式 Agent:Earendil Pi Durable 的可交互复刻 — sloppenheimer · 2026-10-02
- 微软开源 NVX:基于 OpenVMM 的超轻量微 VM 沙箱,专跑不可信 Agent 负载 — unixterminal · 2026-10-02
- exe.dev:别再堆任务管理面板,请少跑一些 Agent — charles_irl · 2026-10-02
- 开发者搭出多智能体 ML 团队:人类只需审批,token 省 40% — kmeanskaran · 2026-10-02