Cognition 总裁:Cerebras 芯片跑自家模型达 950 tokens/s,快得让团队困惑
Sethwinterroth · x · 2026-08-05
Cognition 总裁 Russell Kaplan 在访谈中透露,他们部署的 Cerebras 芯片运行自家模型时速度高达约 950 tokens/s,远超同尺寸模型在 GPU 上的速度,快得让团队一度对测试结果感到困惑。他表示,Cerebras 在价格和吞吐量的帕累托曲线上占据独特位置,虽然服务成本略高,但使他们得以交付原本不可能实现的产品体验。
OpenAI 研究员 Jeffrey Wang 也证实,OpenAI 内部有模型运行在 Cerebras 芯片上,推理速度极快,任务在切换上下文之前就已完成,大幅提升了生产力。他认为延迟是各类部署的主要瓶颈之一,对超低延迟推理的前景感到兴奋。
「Infra」频道最新
- Together AI 月处理 Token 数从 300 亿飙升至 400 万亿 — togethercompute · 2026-08-05
- API 密钥过期致 Agent 失控,一夜烧光 300 美元算力 — voooooogel · 2026-08-05
- 用 GLM 智能体 20 分钟打造像素屏 GPU 集群监控面板 — Porespellar · 2026-08-05
- DeepSeek-V4-Flash 成功在 4 张 4090 上跑通 256k 上下文 — dangerous_inference · 2026-08-05
- Extropic创始人:在确定性硬件上跑概率AI是在交“恶魔税” — beffjezos · 2026-08-05
- 三星展示其3D NAND与HBM5存储技术 — BenBajarin · 2026-08-05