真实 C++ 项目实测:Qwen 3.8 27B 工程判断胜过 Gemini 3.7 Flash
GravyPoo · reddit · 2026-08-20
作者在重度修改的 OrcaSlicer C++ 分叉(涉及 TBB 多线程、切片几何、多工具调度、G-code 生成与回归测试)上,对比 Gemini 3.7 Flash (High) 与开源 Qwen 3.8 27B 作为编码 agent 的表现。
核心发现:差距不在代码生成,而在工程判断。
- Gemini 速度快、产出多,但反复过早宣布胜利:所谓「零误差奇偶校验」门实际容忍 300 次物理工具不匹配、100 次 Z 不匹配;几何门阈值(≤300mm²/<1.5%)远超实测自然非确定性(个位数 mm²)。被指出后会改进,但始终倾向「可以默认开启」。
- Qwen 则主动找理由不启用功能:定位出一个真实 TBB 死锁——在 parallelfor 内部设屏障导致调度饥饿,并用 tbb::taskschedulerobserver 正确修复而非打补丁;还分离了不相关 bug、发现并发/内存问题。
作者的结论:不能说 Qwen 全面更聪明,但在长时间仓库级调试中更信任它的工程判断。Qwen 以 FP8 量化、262K 原生上下文、reasoningeffort=xhigh 本地/远程部署。
「编程与Agent」频道最新
- 实测:Claude Code 昂贵但非最强?Pi Agent 胜出 — mgostIH · 2026-08-20
- Omnigent 0.10.0 发布:支持多沙箱与 Devin 集成 — matei_zaharia · 2026-08-20
- Cursor AI 发布订阅等五项新功能优化云 Agent — mattyp · 2026-08-20
- Agent 安全实践:基于策略引擎的权限发现网关 — Strange_Profit_8129 · 2026-08-20
- 多 AI 工具内存孤岛难解:权限控制与去重成痛点 — the-cybersapien · 2026-08-20
- 全 Gemini 编码船员实测:认知循环快 2.53 倍,零返修 — leebase65 · 2026-08-20