20年工程师实测:Qwen3.8本地写码胜Gemma4,GPT-6.1仍是另一档
therealjerseytom · reddit · 2026-10-11
一位从业约 20 年的软件工程师用真实工作负载对比了 Gemma4-31B 与 Qwen3.8-27B(同为 Q4 量化),并用 GPT-6.1-Sol 做参照:
- 代码库分析:两者分析质量相当。Gemma4 效率明显更高(约 10 次调用 vs Qwen 的 20-30 次)、更聚焦任务本身;Qwen 更"好奇",会主动挖掘超出要求的内容,评估更全面。
- 从零写新项目(C#/WPF,人手需 1-2 天的应用):Gemma4 规划快、执行快,首版 B-,需多轮反馈收敛;Qwen3.8 小错不断(漏 using 等)但更执着、目标更高,首版更好,仅一轮修改即得 B+。
- GPT-6.1-Sol 拿到 A+:一次性产出可直接上线的完整方案,对用户上下文的理解完全不是一个层级。
结论:两款开源模型在消费级硬件上已"可用",但与前沿实验室模型仍有明显差距。作者下一步想测"真正的开发者地狱"——老遗留代码库,比如 Doom 或 Command & Conquer 源码。
「编程与Agent」频道最新
- Nous Research 限时免费上线神秘编程与 Agent 推理模型 — Teknium · 2026-10-11
- 云 Agent 用户梗图:还有人开着笔记本跑任务? — steipete · 2026-10-11
- MCP 服务器+魔兽世界环境:有人想让 AI Agent 住进艾泽拉斯 — djcows · 2026-10-11
- Mac 上让两个清理 agent 收拾多 agent 留下的 100GB 烂摊子 — pvncher · 2026-10-11
- 开发者让 Grok 代理代读代回邮件,公开征集测试来件 — DanielLockyer · 2026-10-11
- 17 轮实测 Haiku 15 次输出格式崩坏,被指不敌 Luna — zeeg · 2026-10-11