Qwen3.8-Flash-Next 登顶 SWE-bench Pro,成本仅 1/9
eyishazyer · x · 2026-08-28
Qwen3.8-Flash-Next 宣称在 SWE-bench Pro 上以 62.5 分击败 Claude Opus 4.6 Max (53.4 分)。这是一个开放权重的多模态 MoE 模型,总参数 125B,但每 token 仅激活 6B 参数,训练成本仅为 Qwen3.7-Plus 的 1/9。
关键指标:
- SWE-bench Pro: 62.5 (Claude Opus 4.6 Max: 53.4)
- LiveCodeBench: 91.9
- GPQA Diamond: 91.7
- 上下文:原生 262K,可扩展至 1M。
争议点:
- Opus 4.6 Max 仍在 HLE 上领先 (40.0 vs 35.9)。
- 1M 上下文下的加速倍数在 Qwen 自家文档中存在矛盾 (宣传页 7.6x/4.9x vs 技术文档 10.2x/6.6x),需待第三方独立验证。
所属事件:Qwen3.8 Flash 登顶 SWE-bench Pro,成本仅竞品九分之一(2 条相关)→
「编程与Agent」频道最新
- 自研框架 OpenPresence:部署自主 Agent 管理多账号 — RichardsonDx · 2026-08-28
- 痛点:AI 计算机使用 Agent 或可解决“通知黑洞” — Darpinian · 2026-08-28
- 新扩展自动转换 Web 表单为 WebMCP 工具 — pvncher · 2026-08-28
- Sentry 工程师反驳:客户端工具搜索太烂,服务器必须自己兜底 — zeeg · 2026-08-28
- 白嫖 Claude Code 实测:代理路由额度秒光,Kaggle 自托管慢到不可用 — phantom_root · 2026-08-28
- METR 评测翻车现场:Agent 怕作弊被抓,主动担心被自动评分器判负 — BLUECOW009 · 2026-08-28