浏览器本地跑30B模型:速度超30 tok/s
MaziyarPanahi · x · 2026-08-13
开发者展示了在 Chrome 浏览器中完全本地运行 Muse Glimmer 30B 密集模型的能力。在处理临床 PII 数据、命名实体识别(NER)及关系提取等任务时,该模型达到了 31.6 tokens/秒的推理速度,凸显了浏览器端侧部署大型 AI 模型的巨大潜力。
「Infra」频道最新
- Hugging Face 发布 datatrove 0.10.0:支持 HF Jobs 流水线,无需 Slurm 集群 — vanstriendaniel · 2026-08-14
- Cerebras部署3T模型需68芯片与1.5MW功耗 — zephyr_z9 · 2026-08-14
- 斥资万亿美元搞基建,只为解百万奖金数学题? — suchenzang · 2026-08-14
- Intel 联手 MiniMax 发布 MXFP4 量化模型,FP4 基准测试登顶 — HaihaoShen · 2026-08-14
- GPU 价格再次暴涨:RTX 6000 Pro 跳涨至 1.5 万 — HankYeomans · 2026-08-14
- 700 欧元组装多卡工作站,本地跑 122B 大模型可行吗? — whatyathinkk · 2026-08-14