Qwen3.8-27B 登陆 Mac,M5 Max 跑出 933 tok/s
max_paperclips · x · 2026-08-15
Qwen3.8-27B 模型发布,MLX-VLM 和 NativAI 宣布提供首发支持。在 M5 Max 128GB 设备上的初步性能测试显示:Prefill 速度达 933 tok/s,Decode 速度为 33 tok/s。模型在 256k 上下文长度下仍能保持连贯性和合理的性能表现。
「Infra」频道最新
- 开源追赶闭源:质量差距仅剩数月 — togethercompute · 2026-08-15
- Valar 核能创始人谈核能如何解锁能源无限 — No Priors · 2026-08-15
- 英伟达拟将对 OpenAI 数据中心的担保从 2500 亿降至 1200 亿 — rohanpaul_ai · 2026-08-15
- Cloudflare 上线 DeepSeek V4:首百万 token 上下文模型 — ritakozlov · 2026-08-15
- 新指标显示密集模型在 bs=1 时受益显著 — teortaxesTex · 2026-08-15
- 监管机构加速AI设施并网:需自费基础设施 — pstAsiatech · 2026-08-15