llama.cpp 编译 WASM+WebGPU,浏览器本地跑 LLM

一位开发者利用周末时间将 llama.cpp 编译为 WASM 并接入 WebGPU 后端,实现 LLM 完全在浏览器客户端运行,推理不经过任何服务器,并放出了概念验证仓库和演示视频。这一实验展示了端侧 LLM 推理的新路径,引发社区关注。

2026-10-06 ~ 2026-10-06 · 3 条相关