llama.cpp 新增决策模型支持:一次前向出概率,最快 3 毫秒
kalyan_kpl · x · 2026-10-03
llama.cpp server 通过新的 /v1/systemone 端点支持「决策模型」:输入状态(文本、JSON 或截图)加带类型的问题,模型在单次前向传播中为每个选项返回概率,而非生成文本再解析。API 兼容 TypeSafe Jev 模型引入的 System One 格式。
- 已支持模型:Julia-1(144M,约 3ms)、Laya(421M,约 5ms)、Kev-4B(4B,约 12ms)、lev(4B,约 36ms)、OpenJev(27B,多语言含中文、支持图片,约 43ms)。
- 典型用途:请求路由、内容审核、校验 agent 步骤是否成功、选择 agent 下一步动作。
- 上手:llama serve -hf ggml-org/Kev-4B-GGUF,问题类型含 choice 等;HF 上有 Decision models 集合与社区 Decision Index 横评。
所属事件:llama.cpp 新增决策模型端点,单次前向返回选项概率(5 条相关)→
「编程与Agent」频道最新
- Meta Muse 下载量破 500 万,AI 反馈循环或成护城河 — RihardJarc · 2026-10-03
- Context.dev 推面向 AI Agent 的网页抓取 API,主打「极致主动性」文化 — DanielLockyer · 2026-10-03
- 从「MCP 是上下文税」到拥抱 MCP:Arize 发布托管 MCP 服务器 — aparnadhinak · 2026-10-03
- 实测 Muse agent:自主比价购物、订召回维修、挂闲鱼卖货 — IanAndrewsDC · 2026-10-03
- AI 能写 CUDA 内核了,内核工程师转向验证与硬件专长 — anneouyang · 2026-10-03
- 域名商 Porkbun 上线代理支付,AI agent 可用 USDC 自主充值注册域名 — kleffew94 · 2026-10-03