Gemma 4 推理速度翻倍,MLX 挑战赛性能提升 130%

TheMoonMidas · x · 2026-09-02

Gemma 4 模型在 MLX 框架下的性能优化取得突破,当前解码速度达到 560 tps,预填充速度达 7k tps(8 个并发请求),相比原始基准实现了 130.7% 的性能提升。该优化工作将被整合进 @darkbloomai。

所属事件:Gemma 4 26B 在 Mac 端推理速度翻倍(3 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →