Qwen3.8-Flash-Next 实测:254K 长上下文首 token 提速 1.56 倍
FantasticNature7590 · reddit · 2026-09-17
- 作者在单张 RTX PRO 6000 Blackwell(96GB)上,用 SGLang 官方 NVFP4 镜像实测 Qwen3.8-Flash-Next,262K 窗口下约 254K 提示的首 token 时间从 34.9s 降到 22.4s,prefill 吞吐从 7,284 提到 11,352 tok/s(1.56×);缓存重复提示时首 token 从 21.7s 降至 0.44s(约 49×)。
- 能力测试:长上下文召回 81/81(窗口填充 99% 仍全对);BFCL 单轮工具准确率 85.2%,多轮仅 49.5%;τ²-bench telecom 完成 68.1%,三次内全部通过率仅 41.2%;对战 gauntlet 中思考模式胜 13/17,关闭后 8/17。
- SVG、视频剪辑与动效设计等生成任务大多通过硬校验,视频剪辑两项获 10/10;作者给出了完整软硬件配置、测试方法与多档上下文长度的延迟/吞吐数据表,是少见的开源栈长上下文系统级实测。
「Infra」频道最新
- Google AI Edge Gallery 上架 Mac,Gemma 4 12B 可跑 16GB MacBook Air — GlennCameronjr · 2026-09-17
- 约 600 天内周 tokens 用量暴涨超 25000%,市场足以多赢家 — brucemacv · 2026-09-17
- Zilliz CTO 提出「One Data、One Index」重构 Agent 检索边界 — J_Luan_ · 2026-09-17
- 小米直播 MIMO-V2.6 后训练过程,每秒烧掉 10 美元 — Dr_Karminski · 2026-09-17
- 博主建议退休人士入手 Nvidia Spark 跑本地模型记录人生经验 — TinfoilTricorn · 2026-09-17
- GPT-4 级推理价格 45 个月暴跌 60 倍,但地板价开始回升 — rohanpaul_ai · 2026-09-17