llama.cpp 新增决策模型:一次前向返回各选项概率,已支持 5 个开源模型

ngxson · x · 2026-10-02

llama.cpp server 通过 /v1/systemone 端点支持「决策模型」(decision models):输入一个状态(文本、JSON 或截图)和带类型的问题,模型在单次前向传播中为每个选项返回概率,而不是逐 token 生成文本再解析。API 兼容 TypeSafe Jev 模型引入的 System One 格式,现有客户端只需换 base URL。

支持的模型(共 5 个开源模型,144M 到 27B):

典型用途包括请求路由、内容审核、校验 agent 步骤是否成功、决定 agent 下一步动作。问题类型分 choice(给选项返回各选项概率)和 score 等。文章给出了快速上手命令(llama serve -hf ggml-org/Kev-4B-GGUF),模型收录于 Hugging Face 的 Decision models 集合,并有社区 Decision Index 供横向比较。

所属事件:llama.cpp 推出决策模型端点,最小 144M 模型仅需 3ms(3 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →