本地实测:Qwen 3.8 27B 靠「过度思考」逼近 Sonnet 水平
maxwell321 · reddit · 2026-08-17
一位用 3×3090 + Tesla P40 跑本地模型的用户深度评测了 Qwen 3.8 27B(Unsloth UD-Q8KXL 量化),结论是其大量的"思考"能挖出训练知识中的细枝末节,性能逼近 Claude Sonnet,并有冲击 Opus 级结果的潜力。
测试方法是用"1:1 复刻经典街机游戏"作为基准 prompt。对比中,Qwen 3.6 27B 的 Galaga 复刻基本成了太空侵略者克隆,敌人不俯冲不射击,细节缺失需要人工补引导;Qwen 3.8 则用像素位图动态构建精灵、带两帧动画、加了 CRT 滤镜和开机模拟,甚至记得并实现了原作的战机捕获机制(救回后双机同屏),仅捕获方式从光束变成撞击。作者认为这大幅缩小了本地模型与专有模型的差距,多花的推理时间和上下文值得。
「模型」频道最新
- 传 OpenAI 预告新模型 Astra,或于月底发布 — haider1 · 2026-08-17
- 开发者评 OpenAI 1M 上下文:无缝压缩是关键 — eyishazyer · 2026-08-17
- 用户反馈 Qwen 模型过度思考:回复 Hi 耗时 23 秒 — malliktwts · 2026-08-17
- Qwen 3.8 与 DeepSeek 4 本地实测:质量显著跃升 — olcan · 2026-08-17
- Sarvam AI 发布 105B 语音模型与全栈 Agent 方案 — AashaySachdeva · 2026-08-17
- 实测 GPT-4o Pro 连续运行突破 2 小时 — banteg · 2026-08-17