Laguna S2.1 新实现:M5 Max 生成 50 tok/s

antirez · x · 2026-07-24

作者表示,GGUF 上游格式变了,所以实现也在同步更新以兼容新的版本。

与此同时,DwarfStar 的 laguna-s2.1 分支里已经加入了一个由 GPT5.6-Sol 编写并手动测试过的 Laguna S2.1 实现;在 M5 Max 上,当前大约能做到 50 tokens/s 的生成速度 和 500 tokens/s 的 prefill。现阶段只支持 Metal,其他后端据称可以再由 GPT5.6-Sol 继续补。

所属事件:GPT5.6 几乎独立写出 Laguna S2.1 推理实现(3 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →