Qwen3.8-27B 优化:长上下文解码提速 3 倍
stargate425 · reddit · 2026-08-22
技术分享显示,通过使用 DFlash2 + XQA 配置,Qwen3.8-27B 模型在 192K 上下文下的解码速度显著提升。在 RTX PRO 6000 Max Q 上实测,BF16 精度下解码速度从 18 tok/s 提升至 58 tok/s,且保持无损。
「Infra」频道最新
- 网友提议将海上石油平台改造成数据中心 — beffjezos · 2026-08-22
- AI 耗能惊人:ChatGPT 查询耗能是谷歌搜索 10 倍 — ingliguori · 2026-08-22
- Google Cloud 推出 Global Front End 跨云网络方案 — rseroter · 2026-08-22
- 观点:禁止数据中心是“奢侈的信仰”,将重创经济 — robleclerc · 2026-08-22
- 模型能效还能提升100倍吗?需架构与推理大变革 — prateekj · 2026-08-22
- GitHub 发布 Agent Plugins 1.0 标准,一次构建跨平台通用 — JeremyCMorgan · 2026-08-22