浏览器里跑 27B 1-bit 模型:6GB 3060 笔记本达 25-30 tok/s
mentria-ai · reddit · 2026-09-09
独立开发者发布的纯 WebGPU/WGSL 浏览器推理引擎 mentria.ai 达成里程碑:Prism ML 的原生 1-bit 模型 Bonsai-27B 在 6GB 显存的 RTX 3060 笔记本上于 Chrome 中实现最高 30 tok/s 解码,无需安装、数据不出本机。关键技术细节:
- 模型每参数约 1.14 bit(符号位 + 每 128 权重一个 scale),27B 参数仅占 3.8GB 显存;
- 1-bit 矩阵-向量核利用「4 个权重仅 16 种部分和」的查表法预计算进片上 scratch,速度翻倍;
- 发现 Ampere scratch 32 bank 冲突导致 kernel 只跑到 38% 带宽,每行加一个 padding 槽解决,单次解码该 kernel 从 26.5ms 降到约 21ms,最终 15→32 tok/s(raw),UI 后实测 25-30;
- prompt 处理重排 tile 后,1489 token 的 prompt 从 29.6s 降到 25.3s;
- 每次改动都验证输出与上一版字节级一致;KV cache 为精确数学无量化,6GB 卡上下文 3072,16GB Mac 可 8192;
- 引擎还支持 0.8B-4B 小模型跑手机、MB 级 LoRA 热切换、视觉输入。
「Infra」频道最新
- vLLM 发布 AgentX 方案:全栈优化真实 Agentic 推理服务 — jfiance · 2026-09-09
- Desert Ant Labs 发布:给所有产品装上端侧智能 — Arcuru · 2026-09-09
- Qwen3-30B-A3B 配 0.6B 草稿模型,本地投机解码提速 1.5 倍 — Arindam_1729 · 2026-09-09
- 投机解码科普:可让 LLM 推理提速约一倍 — blaizedsouza · 2026-09-09
- Cerebras CTO 多场芯片架构演讲几乎无人看,信息高度分散 — blaizedsouza · 2026-09-09
- NVIDIA Cosmos3(64B)INT4 量化版可在 Mac 本地跑文生图与图生视频 — Formal-Swordfish-228 · 2026-09-09