llama.cpp 支持决策模型:单次前向打分,最小 144M 仅需 3ms

ggerganov · x · 2026-10-02

llama.cpp 新增对「决策模型」(Decision Models)的支持,通过 /v1/systemone 端点提供,遵循 TypeSafe Jev 模型引入的 System One 格式,现有客户端只需换 base URL 即可接入。

与聊天模型逐 token 生成不同,决策模型读取输入状态(文本、JSON、截图)一次,直接为你给出的选项打概率分,单次前向即出结果。典型用途包括请求路由、内容审核、agent 步骤校验和下一步动作选择。

目前已支持的模型:

实测速度基于单张 NVIDIA RTX PRO 6000。请求支持 choice、score 等问题类型。快速上手:llama serve -hf ggml-org/Kev-4B-GGUF。

所属事件:llama.cpp 推出决策模型端点,最小 144M 模型仅需 3ms(3 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →