Reddit 用户质疑:DeepSeek 4.1 Flash 与 Qwen3-Coder 的火爆名不副实?
soft_troll · reddit · 2026-10-06
发帖者通过 DeepInfra 实测 DeepSeek 4.1 Flash 和 Qwen3-Coder 48B Turbo 后表示不解:这两个模型虽然极便宜,但在稍复杂的任务上耗时极长、常找不到真正的 bug,只适合脚手架和样板代码,连 React 项目都会「自信地改错」。与 Claude Opus 5.5 相比毫无竞争力。他猜测这类模型的炒作主要在于每美元生成的代码量,而非真正的推理与调试能力,并向社区求证是否遗漏了什么。
「编程与Agent」频道最新
- 跑了几十小时端到端基准,Strata 推理服务器在完整构建任务上翻车 — julianharris · 2026-10-06
- SourceLearn 让智能体沉淀源级能力,15 项评测 13 项第一 — GeorgiaTech · 2026-10-06
- PSA 搜索代理写程序筛选候选,两基准成功率提升 4-7.6 个百分点 — _reachsumit · 2026-10-06
- SWE-Race 基准发布:188 个真实并发 bug,GPT-5.6 Luna 硬题仅 23% — heyitsdannyle · 2026-10-06
- SearchJev 论文:System-1 快速决策让搜索 Agent 提速 4 倍还更准 — _reachsumit · 2026-10-06
- Speck 把认知搬进运行时:qwen3:4b 跑赢裸跑 8B,速度快一倍 — Electronic-Space-736 · 2026-10-06