浏览器本地跑30B模型:速度超30 tok/s

MaziyarPanahi · x · 2026-08-13

开发者展示了在 Chrome 浏览器中完全本地运行 Muse Glimmer 30B 密集模型的能力。在处理临床 PII 数据、命名实体识别(NER)及关系提取等任务时,该模型达到了 31.6 tokens/秒的推理速度,凸显了浏览器端侧部署大型 AI 模型的巨大潜力。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →