Llama 3.1 405B 已在 Cerebras 推理,速度达 5.6k t/s

kimmonismus · x · 2026-08-01

Cerebras 推理服务已上线 5.6k tokens/s 的极速生成,但目前仅向部分受邀客户开放。该速度得益于 Llama 3.1 405B 模型在 Wafer-Scale Engine (WSE) 上的部署。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →