Qwen3.8 27B 评测:一次性编程能力显著提升
kms_dev · reddit · 2026-08-15
对比测试了 Qwen3.8、3.6 和 3.5 三个版本的 27B 模型在 oneshot 编程任务上的表现。
- 改进点:3.8 版本成功生成了可运行的 2048 游戏(3.6 失败),准确绘制了 pelican 场景,并基本正确复现了 Wolfenstein 游戏。
- 评分提升:使用 Claude Sonnet 5 评估,平均评分从 3.5 的 2.46、3.6 的 2.74 提升至 3.8 的 3.00。
「模型」频道最新
- llama.cpp 集成 Moonshot Kimi-K3 文本模型 — pmttyji · 2026-08-15
- GLM 5.3 技术报告揭示使用合成 RL 环境训练 — burny_tech · 2026-08-15
- Qwen2.5 vs Qwen2 vs Gemma 4:30B级开源模型实测 — MaySaki2 · 2026-08-15
- 测试 Fable 5 模型用于蒸馏的重定向行为 — teortaxesTex · 2026-08-15
- Gemini 3.7 Flash:可实时生成完整交互式网站 — _philschmid · 2026-08-15
- Qwen 3.8 27B 在某 Harness 下几乎不思考的测试 — rosie254 · 2026-08-15