单卡B300跑1.6T模型:新量化框架实现50 tok/s
dosco · x · 2026-08-13
Tim Dettmers 预告即将发布一款全新的量化推理框架。该框架能够让 1.6T 参数的模型在单张 B300 GPU 上运行,并保持良好的质量与约 50 tok/s 的生成速度,大幅降低了本地部署超大模型的算力门槛。
「Infra」频道最新
- ComfyUI 双显卡部署踩坑:第二张 GPU 导致显存溢出 — tricck3zz · 2026-08-13
- 大模型API定价逼近成本线:Kimi K3托管利润被榨干 — sergeykarayev · 2026-08-13
- 分析称算力供应链现「LTA 瀑布流」,层层绑定创历史规模 — BenBajarin · 2026-08-13
- 百元级 AMD 显卡跑 Qwen 3.6 35B:优化后达 21 token/s — Sweaty_Perception655 · 2026-08-13
- Cohere 模型支持 MLX,可在苹果设备本地快速运行 — cohere · 2026-08-13
- 淡马锡首次买入三星与SK海力士,押注AI存储芯片 — basedjensen · 2026-08-13