Qwen 3.8 27B Aider 跑分 72.9,追平一年前 Gemini 2.5 Pro

Baldur-Norddahl · reddit · 2026-08-24

作者在 vLLM 上以 FP8 权重 + FP8 KV cache、256K 上下文跑 Aider 基准测试,Qwen 3.8 27B 得分 72.9,追平 2025-04 的 Gemini 2.5 Pro(72.9),超过 Claude Opus 4(72.0)与 DeepSeek R1(71.4)。

作者感慨:虽然只是个偏旧的基准,但 MacBook 上跑的模型已能追平一年多前的 SOTA。他还提到实际表现更好,因为 harness 变强了——用 DeepSeek Harness 时基本能解掉绝大多数 Aider 测试,只是常需超过 2 轮。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →