llama.cpp 推出决策模型端点,最小 144M 模型仅需 3ms
llama.cpp 服务器新增 /v1/systemone 端点,正式支持「决策模型」(Decision Models),遵循 TypeSafe Jev 模型引入的 SystemOne 规范。用户输入一段状态(文本、JSON 或截图)及若干带类型的问题,模型经单次前向传播即可直接返回各选项的概率打分,无需多轮生成。目前已支持 5 个开源决策模型,最小模型仅 144M 参数,推理耗时低至 3ms,大幅降低了在端侧或低延迟场景中做结构化决策的成本。
2026-10-02 ~ 2026-10-02 · 3 条相关
- llama.cpp 新增决策模型:一次前向返回各选项概率,已支持 5 个开源模型 — ngxson · 2026-10-02
- llama.cpp 新增决策模型端点,单次前向给出选项概率 — ggerganov · 2026-10-02
另有 1 条近重复转述:ggerganov