Llama 3.1 405B 已在 Cerebras 推理,速度达 5.6k t/s
kimmonismus · x · 2026-08-01
Cerebras 推理服务已上线 5.6k tokens/s 的极速生成,但目前仅向部分受邀客户开放。该速度得益于 Llama 3.1 405B 模型在 Wafer-Scale Engine (WSE) 上的部署。
「Infra」频道最新
- antirez 关注 DGX Spark 部署大模型方案 — antirez · 2026-08-01
- Modal 发布硬核 GPU 术语表,涵盖硬件到软件全栈 — charles_irl · 2026-08-01
- ARM 引入 FEAT_CSSC 扩展:原生支持通用寄存器 popcount — lemire · 2026-08-01
- 推理费每天超 750 美元就该自研?Pallet 分享模型训练账本 — marcbhargava · 2026-08-01
- 实测百 GB 级音频大模型本地推理:1M 上下文吃满 127GB 内存 — andimarafioti · 2026-08-01
- MediaTek 预计明年下半年推出 400G/448G SerDes IP — rwang07 · 2026-08-01