Qwen 3.8 27B 上线 Cerebras,推理速度达 1500 tokens/秒
altertable · hn · 2026-09-04
阿里 Qwen 3.8 27B 模型已可在 Cerebras 推理平台上使用,官方文档标注推理速度高达 1500 tokens/秒,适合对延迟敏感的 agent 与编码场景。开源中型模型 + 超快推理的组合进一步降低了低成本高吞吐部署的门槛。
「Infra」频道最新
- 开源项目 Marin 启动 535B/A23B MoE 训练,一年内从 1 人扩到 10 人 — wandb · 2026-09-04
- 研究称让 AI 造 App 的环境成本可达快速提问的 1 万倍 — shiringhaffary · 2026-09-04
- 本地 AI 服务器噪音救星:主板 BMC 带外管理调风扇转速 — HankYeomans · 2026-09-04
- Qwen3.8 27B 上线 Cerebras,推理速度高达 1500 tokens/s — gibbonwalker · 2026-09-04
- DiffusionGemma-26B-A4B 上线:单张 B200 跑块扩散解码,800+ tok/s — TheMoonMidas · 2026-09-04
- Databricks 从追踪数据挖出每年 120 万美元 AI 浪费 — matei_zaharia · 2026-09-04