Qwen3.8-Flash-Next 砍掉 44% 专家,Terminal-Bench 达 70%
rmonsurate · reddit · 2026-10-01
作者用实验室的 Dell B300 对 Qwen3.8-Flash-Next 做了两个开源微调版本。
Victoria(编码与 Agent)
- 用 REAP 技术把每层专家从 512 砍到 288,模型缩小 44%
- 之后以 4-bit(NVFP4)重新训练,让模型适配实际发布格式,而非事后量化
- Terminal-Bench 2.1:三次平均 70.0%(此前 NVFP4 版本为 62.5%);HumanEval 159/164
- 权重 48.0 GiB(含 draft head),另有 95.4 GiB n-gram 表不计入
- 单张 B300 单流 280 tok/s(带 draft head),不带则 135 tok/s
- GGUF Q4KM 为 49.17 GiB,Terminal-Bench 75.3%(单次,噪声较大)、HumanEval 93.2%
- 输出 token 比上一版少 35%
Maple(加拿大本地化)
在 Victoria 基础上针对加拿大用户微调,让模型默认按加拿大而非美国回答税务、福利与法规问题。600 道留出题(带搜索)上:引用官方加拿大来源从 6.0% 升至 62.9%;完全正确从 6.6% 升至 21.8%;「无答案」从 47.2% 降至 23.7%;对自称非加拿大用户强推加拿大答案的比例从 2.9% 降至 1.0%。HumanEval 保持 157/164。
作者提醒 llama.cpp 用户:GGUF 带 draft head,主线尚不支持会报错,需用其 fork 的 qwen4exp-mtp 分支。
「模型」频道最新
- Brundage 称 Codex ultrafast 模式多数任务过于奢侈,不如多开并行 — Miles_Brundage · 2026-10-01
- 传 Gemini 4 argon 分钟内超量子算法优化基线 40%,业界惊叹 — DynamicWebPaige · 2026-10-01
- Codex Ultra Fast 模式烧钱如流水,圈内外热议算力鸿沟 — herbiebradley · 2026-10-01
- Reddit 讨论:本地模型做 Blender 建模仍然力不从心 — Any-Lingonberry7411 · 2026-10-01
- Rox 实测:Jev 重排检索比 GPT-5 Mini 快 20 倍、便宜 10 倍 — hardimanjames · 2026-10-01
- Nat Lambert 谈 Gemini 4:更多前沿实验室竞争是好事 — natolambert · 2026-10-01