实测:Qwen3.8:27B 本地移植 3.9 万行 C 代码完败 Opus 5
codehamr · reddit · 2026-08-24
作者测试新版 Qwen3.8:27B 能否完成一项硬核任务:把约 60 万 token(2.1 MB、3.9 万行)的单文件 C 程序一次性移植为单文件 HTML/three.js。环境为 vLLM FP8、FP8 KV cache、262k 上下文、RTX 6000 Pro 96GB。结果对比:
| Agent | 模型 | 耗时 | 输出行数 | 结果 |
|---|---|---|---|---|
| Claude Code | Opus 5(云端参考) | 21 分钟 | 1759 | 尚可 |
| hermes | Qwen3.8:27B | 4小时18分 | 949 | 差 |
| codehamr | Qwen3.8:27B | 1小时40分 | 1056 | 差 |
只有 Opus 版本达到「可玩」质量。作者的核心观察:本地模型成败仍取决于 prompt——同样的权重在两个差异极大的 harness 下产出同样的坏结果;冗长的 harness 救不了薄弱的 prompt,只是白烧 GPU 时间。最扎眼的差距是时间:本地数小时 GPU 时间 vs 云端 21 分钟。作者开源了 C 原作和自研 harness。
「编程与Agent」频道最新
- Cloudflare 开源 AI OS,用安全模型解决数据隐私风险 — irvinebroque · 2026-08-24
- Agent 不是聊天,而是带任务队列的调度器 — andreisavu · 2026-08-24
- Stripe Link 推出 CLI,让 Agent 安全完成代理支付 — jeff_weinstein · 2026-08-24
- 如何优化 Agent 记忆检索策略与时机? — Bobsthejob · 2026-08-24
- Claude Opus 严重翻车:无视指令且工具调用乱飞 — taylorwilsdon · 2026-08-24
- Agent工具参数会「编造」:一份输入消毒清单防注入 — blaizedsouza · 2026-08-24