闭式权重手术:少量校准样本把 4B 能力移植进 0.8B 模型

AdventurousTwo6445 · reddit · 2026-10-06

作者跳过耗时数周、需数十亿 token 的标准蒸馏,改用闭式解法:在少量校准 prompt 上提取层间隐状态轨迹,直接求解学生模型 SwiGLU MLP 块的权重更新。

关键发现:

作者列出待验证方向:在 24-32GB 显卡上把 Qwen3.8-27B 的推理能力移植到 9B/4B/2B、把 Gemma-4-31B 压缩到移动级、用 SAE 解开中间层 1-22 的纠缠。代码与基准日志已开源(GitHub DynamicTune),权重发布于 Hugging Face(F-Labs/Qwen3.5-0.8B-DynamicTune-Base)。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →