llama.cpp 新增决策模型端点,单次前向给出选项概率

ggerganov · x · 2026-10-02

llama.cpp 服务器新增 /v1/systemone 端点,支持「决策模型」(Decision Models):发送一段状态(文本、JSON 或截图)加若干带类型的问题,模型在单次前向中为每个选项返回概率,而非逐 token 生成文本再解析。接口遵循 TypeSafe Jev 模型引入的 System One 格式,现有客户端只需改 base URL,实现见 PR #29818。

典型用途:请求路由、内容审核、校验 agent 某步是否成功、选择 agent 下一步动作。

首批支持模型(单卡 RTX PRO 6000 上单问题中位延迟):

快速上手:llama serve -hf ggml-org/Kev-4B-GGUF。请求包含状态与问题,问题类型有 choice(返回最优选项及各选项概率)、score 等。模型可在 Hugging Face 的 Decision models 集合中找到,社区还维护了对比用的 Decision Index,后续会有更多模型加入。

所属事件:llama.cpp 推出决策模型端点,最小 144M 模型仅需 3ms(3 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →