实测:Qwen 3.8B 多 Token 预测提升可行性
adrianscottcom · x · 2026-08-26
用户在讨论中反馈,Qwen 3.8B 开启多 Token 预测(MTP)后,在实际使用中显著提升了快速可行性。回复中提到其在本地配合 DwarfStar 4 (ds4-flash)、Qwen 3.8B-27B 和 Hermes Agent 进行了实践。
「模型」频道最新
- 正式宣布:视频模型进入「后训练时代」 — gorkem · 2026-08-26
- Accelerated Understanding 推出基于神经算子架构的新 AI 模型 — badumtsssst · 2026-08-26
- Nvidia 或提供算力支持 GLM 5.3 免费开放 — bindureddy · 2026-08-26
- 微调谬误:模型饱和后成本比质量更重要 — rhythmrg · 2026-08-26
- sanoTTS:140 万参数模型在 $3 芯片上实时运行 — kastnerkyle · 2026-08-26
- 本周新模型盘点:视觉编码器与机器人基础模型 — TheTuringPost · 2026-08-26