Qwen3.8-Flash 开源:卷死 DeepSeek,4090 跑 1M 上下文
量子位 · wechat · 2026-08-28
阿里千问发布并开源 Qwen3.8-Flash 模型,采用 125B MoE 架构,每 Token 激活约 6B 参数。该模型原生支持 262k 上下文,可扩展至 1M token。
核心亮点:
- 性能:发布即登顶 Hugging Face 榜首,在通用、数学、编程能力上超越 Qwen3.7Plus。
- 成本:百万 Tokens 输入仅 0.8 元(输出 2.7 元),价格约为 DeepSeek-V4-Flash 的 1/3。
- 部署:消费级 4090 显卡即可运行数据中心级长文本模型,大幅降低门槛。
- 实测表现:办公场景实测中,2 分钟生成多平台文案,4 分钟处理万字会议纪要并输出执行方案。
「Infra」频道最新
- Qwen 模型双卡推理优化:预填提速 10 倍实战 — Comrade_Mugabe · 2026-08-28
- 本地 AI 的真正价值是数据主权而非省钱 — StewartalsopIII · 2026-08-28
- 英伟达联手华尔街推5000亿算力融资,被指引爆次贷危机 — 创业邦 · 2026-08-28
- RTX 3060 12GB:本地 AI 性价比之王实测 — I_Play_Zed · 2026-08-28
- 用 Langfuse 轨迹分析自动改进 Agent 工作流 — NielsRogge · 2026-08-28
- 英伟达助筹 5000 亿美元基建,不仅卖铲子还开矿 — VraserX · 2026-08-28