把 Qwen3.8 的 n-gram 记忆移植进 0.8B 小模型,困惑度降 5.05%
Nicolodeva · reddit · 2026-09-25
独立实验 Qwengram-0.8B:作者尝试把 Qwen3.8-Flash-Next 预训练的约 51B 参数 PLE n-gram 记忆迁移到 Qwen3.5-0.8B 上。骨干与 PLE 记忆全部冻结,仅在解码器第 3、9 层训练一个 R=1 reader,配合 token 级动态线性门控做后层注入,不做任何骨干微调。在完整验证集上 NLL 从 2.906 降至 2.854,困惑度从 18.28 降至 17.35(降 5.05%)。
关键发现
- 真实预训练 PLE 优于随机记忆与置换记忆对照
- reader 训练 20M token 时聚合损失更低但数学回退,最终选 15M 平衡点;R=4 reader 会引入代码与数学回退,保留 R=1
- 固定后层注入伤 LAMBADA,动态 token 级门控能恢复大部分损失;同记忆预算下学习式放置优于按不确定性路由
- Q80 量化保留 99.1% 的 BF16 reader 增益
已在 llama.cpp 实现推理路径,PLE 以外部量化 sidecar 形式加载。模型/训练代码/运行时均已开源,作者计划下一步在 35B-A3B MoE 上复现。
「模型」频道最新
- 同一提示词实测:Opus 5.5 动态视频设计大幅碾压 GPT — thisiskp_ · 2026-09-25
- Google 编码模型三周连发三版,博主预测 Gemini 4 下月发布 — haider1 · 2026-09-25
- 曝智谱 GLM-5.3-Flash 单流 240 tok/s,速度实测引关注 — SIGKITTEN · 2026-09-25
- 网友称现有 IQ 测试已被模型触及天花板,呼吁更好的智能测试 — iruletheworldmo · 2026-09-25
- 用 Claude 生成天野尚风格 Three.js 水族箱,连大和藻虾都加上了 — nptacek · 2026-09-25
- 用户控诉 Google:$20 AI 附加费后企业版 Gemini 卡在旧模型 — thedealdirector · 2026-09-25