Qwen2.5-72B 本地性能逼近 Claude 3.5 Sonnet
AGI Hunt · wechat · 2026-08-15
AGI Hunt 评测 Qwen2.5-72B 模型(原文中称为 Qwen-3.8-27B),认为只要 16G 显存即可在本地运行接近 Claude 3.5 Sonnet (原文称 Opus4.6 Max) 级别的模型。
关键数据:
- SWE-bench Pro: 61.7 (超过 Opus 4.6 Max)
- Qwen SWE-Bench: 79.0 (超过 Opus 4.6 Max)
- TerminalBench: 73.0 (接近)
- NL2Repo-Bench: 42.3 (接近)
部署建议:
- 4-bit 量化约需 16GB 内存,速度约 25-40 tok/s。
- Mac 用户推荐 MLX/LMStudio/llama.cpp;PC 用户推荐 vLLM。
作者还提到 Meta 的 Muse (Llama 3.1 405B) 发布,并预测两年内笔记本运行 Fable5 (推测指 GPT-5 级别) 级别模型将成为现实。
「Infra」频道最新
- KV Cache 科普:缓存注意力键值让 LLM 推理大幅提速 — blaizedsouza · 2026-08-17
- 澳政府视角:算力、AI经济与国家战略 — joecole · 2026-08-17
- 清华系团队打造自进化算力底座,国产芯片适配提速30倍 — 量子位 · 2026-08-17
- Omarchy:DHH 推荐的 Agent 优先 Linux 操作系统 — vista8 · 2026-08-17
- Llama-3.0-Flash 被曝可在单台 DGX Spark 上运行 — Affectionate-File-26 · 2026-08-17
- AWS Trainium 4预计2027-2028年大规模部署,配置曝光 — zephyr_z9 · 2026-08-17