纯浏览器跑 37GB Qwen MoE:专家权重从磁盘流式加载,输出对齐 llama.cpp

naklitechie · reddit · 2026-10-06

LocalMind 是一个纯静态网页(无服务器、无安装),通过 WebGPU 在浏览器标签页里跑本地模型。新版本实现生成时从磁盘流式读取 MoE 专家权重,让模型可以超过机器内存大小,且输出与 llama.cpp 逐 token 对齐。

实现方式:GGUF 首次加载进浏览器私有文件系统 OPFS;稠密权重、路由器和 KV cache 放 GPU,被路由的专家留在磁盘,由 worker 池按需同步读入 GPU 槽位缓存(LRU + 两层预取);trunk 内核是手写 WGSL,照 llama.cpp 计算图实现,便于逐 token 对拍。

实测数据(MacBook M4 Pro 24GB,Chrome):

整个应用仍是单个 index.html(brotli 后 854KB),磁盘层单独抽成了库 diskformer.js。作者检索后认为这是首个生成期间从磁盘读权重的浏览器引擎;限制是仅测过 Chrome/Edge + WebGPU 一台机器,且速度仍慢于原生。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →