llama.cpp 新增 Decision Models:单次前向打分替代逐 token 生成
adnan_hashmi · x · 2026-10-03
Hugging Face 发布社区文章,介绍 llama.cpp server 通过 /v1/systemone 端点支持「决策模型」(decision models):输入一个状态(文本、JSON 或截图)和带类型的问题,模型单次前向传播即返回每个选项的概率,兼容 TypeSafe Jev 模型引入的 System One 格式,老客户端只需改 base URL。
- 原理:聊天模型每个输出 token 耗一次前向且需解析;决策模型读一遍输入,答案必然是给定选项之一并附带概率。
- 典型用途:请求路由、内容审核、校验 agent 步骤是否成功、决定 agent 下一步动作。
- 支持模型:Julia-1(144M,3ms)、Laya(421M,5ms)、Kev-4B(4B,12ms)、lev(4B,36ms)、OpenJev(27B,43ms,支持中英德法等多语言与图像),均基于 mmBERT 或 Qwen3.5 系列。
文章给出 quick start:llama serve -hf ggml-org/Kev-4B-GGUF,问题支持 choice 等类型,相关模型收录于 Decision models collection,社区 Decision Index 提供横评。
所属事件:llama.cpp 新增决策模型:单次前向输出选项概率(8 条相关)→
「编程与Agent」频道最新
- 教程:用 Claude Code 快速实现网页光标追踪特效 — Tegadesigns · 2026-10-03
- Bindu Reddy 称 Fable 5.5 大幅减少幻觉并快速复刻小型模型技术 — bindureddy · 2026-10-03
- Anthropic 工程师:未来模型将更擅长删代码与化简 — simpsoka · 2026-10-03
- 好的 AI 工作流不是点击最少,而是把摩擦留在会出错的地方 — alifcoder · 2026-10-03
- 用 Opus 5.5 从零做浏览器 3D 游戏,AI 开发实战亮相 — jason_mayes · 2026-10-03
- Cloudflare Durable Objects 支持无客户端时继续长任务 — threepointone · 2026-10-03