本地跑 Qwen3.8-27B:10GB 显存、170ms 延迟、多模态决策
kyr0x0 · reddit · 2026-09-23
作者发布 Bonsai-Llama-Jev,一个基于 Qwen3.8-27B Q264 与 llama.cpp 的本地「类型化决策」推理系统,保留 OpenAI API 兼容。
关键数据
- 在覆盖 175 个用例、超 22,000 次决策的 typed-decision-bench 上,Soft Accuracy 约 76%,对比 Jev-1.13 的约 88%,领先 Von-1.1、Laya 及 Qwen3.5-4B。
- 显存占用 <10GB(含 KV cache 与视觉投影器),p50 延迟约 171ms,对比 Jev 的 716ms,约快 4 倍。
- 校准误差 ECE-15 仅 13%,优于 Jev 的 8.4%。
技术要点
- 基于 PrismLM 的 llama.cpp fork,在引擎内直接实现 TypeSafe AI 的 System One API,新增 POST /v1/systemone 端点,与官方 Python/JS SDK 端到端测试通过。
- 作者提出 calibration.json 后验校准标准,方法来自其 VAE Auto Research Harness 发现的数学技巧。
- 号称首个支持多模态类型化决策的开源 Jev 类方案,可直接从图像+文本/JSON 做结构化决策。
- 在 RTX 5090 上聊天约 143 tok/s。
「Infra」频道最新
- 网友发布 Qwen3.8 27B 量化版:单卡 Strix Halo 跑一周,质量胜过 ISTA 与 Unsloth — Dutchnamn · 2026-09-23
- crabbox 上线 boxd:本地编辑,命令跑在毫秒级启动的隔离微虚拟机 — steipete · 2026-09-23
- AI 数据中心功耗从 5 兆瓦飙到 1000 兆瓦,涨了 200 倍 — Olivier__OG · 2026-09-23
- 开发者用 Rust 写权重流式引擎,RTX 3060 12GB 跑动 FLUX.2 9B — madtune22 · 2026-09-23
- AMD MI355X 每美元性能达 DGX B300 的 1.7 倍 — zephyr_z9 · 2026-09-23
- 云栖大会最大看点不是新模型,而是 AI 全栈生态成型 — manishkhosiya · 2026-09-23