把 Qwen3.8 的 n-gram 记忆移植进 0.8B 小模型,困惑度降 5.05%

Nicolodeva · reddit · 2026-09-25

独立实验 Qwengram-0.8B:作者尝试把 Qwen3.8-Flash-Next 预训练的约 51B 参数 PLE n-gram 记忆迁移到 Qwen3.5-0.8B 上。骨干与 PLE 记忆全部冻结,仅在解码器第 3、9 层训练一个 R=1 reader,配合 token 级动态线性门控做后层注入,不做任何骨干微调。在完整验证集上 NLL 从 2.906 降至 2.854,困惑度从 18.28 降至 17.35(降 5.05%)。

关键发现

已在 llama.cpp 实现推理路径,PLE 以外部量化 sidecar 形式加载。模型/训练代码/运行时均已开源,作者计划下一步在 35B-A3B MoE 上复现。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →