本地实测显示 Qwen Flash Next 跑分强但长任务不及 27B

多位开发者对 Qwen Flash Next 进行本地实测,发现其在 iq4xs 量化下 one-shot 表现和基准测试成绩出色,但在长期 agentic 助手任务中不及 Qwen3.8 27B。另有开发者在真实的编程工作流(spec → 实现 → review ↔ 返工)中对比两款模型,发现尽管 Flash Next 基准分更高,27B 本地量化版在编程任务上反而反超云端 Flash Next,再次凸显跑分与实际使用体验之间的差距。

2026-10-06 ~ 2026-10-07 · 2 条相关