浏览器里纯WASM跑LLM
celsowm · reddit · 2026-07-15
这个项目把 LiquidAI 的 LFM 2.5-350M 做成了一个完全在浏览器本地运行的推理 demo:不走后端、不依赖 WebGPU,直接用纯 WebAssembly 执行。
关键实现
- 手写 WASM SIMD 内核,覆盖 gemm/gemv、GQA attention、conv、RoPE 等。
- 模型权重做了 4-bit 量化(Q40),attention 投影用 Q8。
- 支持 batched prefill,避免 prompt 逐 token 预处理。
- 前端提供了聊天 UI、流式输出、停止按钮、实时 tok/s 和 markdown 渲染。
部署方式
- 权重托管在 Hugging Face:celsowm/lfm2.5-350m-wasm-q40
- 应用静态部署在 GitHub Pages
- 页面加载时从 Pages 拉词表/merges,从 HF 拉权重,然后全部本地推理
作者还给出了在线体验、GitHub 仓库和模型权重链接。
「Infra」频道最新
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- SF Compute 创始人:现在买算力是「绝对糟糕的体验」 — IgorCarron · 2026-09-11
- 开源 SmolVM:2026 年 Agent 不止用浏览器,而是拥有整台电脑 — aniketmaurya · 2026-09-11
- PyTorch Day Korea 2026 首届线下大会启动,9月13日截止征集演讲 — PyTorch · 2026-09-11
- 本地跑 LLM 选卡:4 张 CMP-170HX 涨价 vs Mac Studio M5 — rumboll · 2026-09-11
- llama.cpp 为 RDNA4 调优 Flash Attention,大上下文提升明显 — pmttyji · 2026-09-11