llama.cpp 推出决策模型端点,最小 144M 模型仅需 3ms

llama.cpp 服务器新增 /v1/systemone 端点,正式支持「决策模型」(Decision Models),遵循 TypeSafe Jev 模型引入的 SystemOne 规范。用户输入一段状态(文本、JSON 或截图)及若干带类型的问题,模型经单次前向传播即可直接返回各选项的概率打分,无需多轮生成。目前已支持 5 个开源决策模型,最小模型仅 144M 参数,推理耗时低至 3ms,大幅降低了在端侧或低延迟场景中做结构化决策的成本。

2026-10-02 ~ 2026-10-02 · 3 条相关

另有 1 条近重复转述:ggerganov