Qwen 3.8 27B Aider 跑分 72.9,追平一年前 Gemini 2.5 Pro
Baldur-Norddahl · reddit · 2026-08-24
作者在 vLLM 上以 FP8 权重 + FP8 KV cache、256K 上下文跑 Aider 基准测试,Qwen 3.8 27B 得分 72.9,追平 2025-04 的 Gemini 2.5 Pro(72.9),超过 Claude Opus 4(72.0)与 DeepSeek R1(71.4)。
作者感慨:虽然只是个偏旧的基准,但 MacBook 上跑的模型已能追平一年多前的 SOTA。他还提到实际表现更好,因为 harness 变强了——用 DeepSeek Harness 时基本能解掉绝大多数 Aider 测试,只是常需超过 2 轮。
「模型」频道最新
- OpenAI 推出 5.6 sol 更新,实测表现优于 fable — i_dg23 · 2026-08-24
- Google Gemma-4-26B 成功移植 Apple Silicon,显存占用减半 — jasonkneen · 2026-08-24
- McByte 登顶 SportsMOT 榜单,用分割掩码解决遮挡 — huggingface · 2026-08-24
- Opus 3 与 Opus 5:模型对齐与表达的变化 — repligate · 2026-08-24
- 实测 RTX 5000 Pro 跑 Qwen3.8 性价比炸裂 — Valuable-Run2129 · 2026-08-24
- Anthropic 半年未升级 Opus 模型 — tenobrus · 2026-08-24