不到10GB显存跑276B大模型!Mference实测近3 tok/s

Blahblahblakha · reddit · 2026-08-06

开发者开源了 Mference(基于 Swift + Metal),成功在不到 10GB 内存的消费级硬件上运行了 276B 参数的 MoE 模型 Inkling-Small(活跃参数约 12B)。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →