DeepSeek v4 Flash 等本地模型编程实测:Qwen 122B 性价比反超
returnity · reddit · 2026-08-05
作者在 M5 Max 128GB 设备上,使用 Aider Polyglot 的 109 个子集问题,对 DeepSeek v4 Flash 及多款 Qwen、Gemma 模型进行了 Agentic 编码能力横评。
核心结论:
- DeepSeek v4 Flash (High) 总体正确率最高,但为了达成任务消耗的 Token 数量是 Qwen3.5-122B 的 5 倍以上。
- Qwen3.5-122B 表现出极高的性价比,且在首次尝试的通过率上大幅领先 DeepSeek。
- Qwen3.6-27B-ThinkingCap 微调版表现优异,能用基础版 20-30% 的 Token 完成相同任务,有效解决了过度思考问题。
测试还排除了因 linter 空报错导致模型陷入死循环的 2 个问题,并详细记录了上下文溢出和超时情况。
「模型」频道最新
- 英伟达发布340亿参数开源VLA模型Alpamayo 2 Super — drmapavone · 2026-08-05
- 曝OpenAI新模型gpt-5.6-luna因性价比过高致服务器过载 — _lewtun · 2026-08-05
- Anthropic Opus 5 被指输出严重退化:满口术语 — TheTuringPost · 2026-08-05
- AI 也需要补觉?开发者曝光 GPT 思维链搞笑翻车 — cantrell · 2026-08-05
- engyai 上线 OpenRouter 最廉价 Kimi K3 API,成本降半 — const_reborn · 2026-08-05
- LiquidAI 新模型实测:Mac 本地跑 128K 上下文解码达 82 tok/s — helloiamleonie · 2026-08-05