Qwen 2.5 72B 本地实测:长上下文吞吐跌一半
julianharris · x · 2026-09-01
在 MacBook Pro M5 Max 上测试 Qwen 2.5 72B (Qwen 3.8) 的 MTPLX 部署表现。测试发现,随着上下文窗口扩大,27B 模型的吞吐量显著下降;而 Flash-next(Qwen 4 preview)的衰减幅度小得多,虽不及云端 Opus 但表现良好。
所属事件:128GB Mac 实测 Qwen 3.8:更强但内存需求高(2 条相关)→
「模型」频道最新
- Opus 5 易泄露原因猜想:混用新旧训练格式 — Ratter · 2026-09-01
- Opus 训练格式变更:从纯文本到 XML 标签 — Ratter · 2026-09-01
- Opus 模型 Role Token 变化观察 — Ratter · 2026-09-01
- Qwen3.8-27B-TURBO-Fable-Cold-Fusion-735-882-Heretic-Uncensored 登顶 HF — DavidAU · 2026-09-01
- Matrix-Game 3.5:用 Patch Memory 增强实时流式世界模型 — Runjia Qian · 2026-09-01
- Qwen 团队发文解析 Qwen3.8-Next 架构设计 — Qwen · 2026-09-01