llama.cpp 新增决策模型:单次前向输出选项概率
llama.cpp 作者 ggerganov 宣布在最新构建中新增「决策模型」支持,通过服务器新端点 /v1/systemone 提供:输入一段状态(文本、JSON 或截图)和若干带类型的问题,模型在单次前向传播中为每个选项直接返回概率,而非逐 token 生成文本再解析。该特性已在社区引发广泛关注。
已确认
- 由 ggerganov 本人发布,端点为 /v1/systemone,遵循 TypeSafe Jev 模型引入的 System One 格式,API 兼容该格式。
- 输入支持文本、JSON 和截图形式的状态,问题带类型标注。
- 最小模型仅 144M 参数,推理最快约 3ms;ngxson 确认已支持 5 个开源模型且数量持续增加。
- 现有客户端只需更换 base URL 即可使用,可本地、高效、私密地运行 Jev 风格推理。
- Hugging Face 上 ggml 官方博客已发布介绍文章,paf1138、adnanhashmi 等用户转述了该文内容。
- solyarisoftware 转述指出,该端点适合请求路由、工具选择以及校验 agent 输出等场景。
为什么重要
- 决策模型将「生成式」调用变为「打分式」调用,省去逐 token 生成的开销与输出解析的不确定性,适合高频、结构化的决策场景。
- 3ms 级的本地推理让轻量模型可用于实时交互与隐私敏感场景,为本地推理提供了新玩法。
- mitsuhiko(Flask 作者 Armin Ronacher)等知名开发者转发关注,显示该特性在开发者社区中的影响力。
2026-10-02 ~ 2026-10-03 · 8 条相关
一手来源
- llama.cpp 新增决策模型端点,单次前向给出选项概率 — ggerganov ·
- llama.cpp 支持决策模型:单次前向打分,最小 144M 仅需 3ms — ggerganov ·
- llama.cpp 新增决策模型:一次前向返回各选项概率,已支持 5 个开源模型 — ngxson ·
- llama.cpp 新增 Decision Models,本地推理迎来新玩法 — paf1138 · 2026-10-02
- 【源头】llama.cpp 新增决策模型:一次前向返回各选项概率,已支持 5 个开源模型 — ngxson · 2026-10-02
- llama.cpp 上线 /v1/systemone 端点,支持本地决策模型推理 — mitsuhiko · 2026-10-03
- llama.cpp 新增 /v1/systemone 端点,本地运行决策模型直接输出概率 — solyarisoftware · 2026-10-03
另有 4 条近重复转述:ggerganov · ggerganov · adnan_hashmi · kalyan_kpl