闭式权重手术:少量校准样本把 4B 能力移植进 0.8B 模型
AdventurousTwo6445 · reddit · 2026-10-06
作者跳过耗时数周、需数十亿 token 的标准蒸馏,改用闭式解法:在少量校准 prompt 上提取层间隐状态轨迹,直接求解学生模型 SwiGLU MLP 块的权重更新。
关键发现:
- 跨架构稳定:在现代 Qwen 3.5(4B→0.8B)和以脆弱著称的 GPT-2 small 上均验证有效,通用语言能力保持完整、退化有界。
- 谱熵屏障:改动 Qwen-0.8B 全部 24 层会毁掉模型(NLL +64.78%)。层扫描显示中间层 1-22 处于稠密叠加态(熵 >0.90,是多语义纠缠点);只对 4 个锚块(层 0、7、15、23)动手术即可:30 个任务上 held-out NLL 降 10.8%(生物医学 -23.8%、数学 -14.6%),400 任务 HellaSwag +0.50%(Vulkan llama.cpp)。
- 行为变化:原版 0.8B 写二叉树反转只会输出注释掉的死代码,手术后能写出带正确基线的递归 Python;逻辑题上会自发触发 <think> 推理链。
- 硬件门槛低:全部提取与手术在 8GB 显存的 RX 580 上本地完成,用逐层 GPU streaming 加 DirectML attention patch。
作者列出待验证方向:在 24-32GB 显卡上把 Qwen3.8-27B 的推理能力移植到 9B/4B/2B、把 Gemma-4-31B 压缩到移动级、用 SAE 解开中间层 1-22 的纠缠。代码与基准日志已开源(GitHub DynamicTune),权重发布于 Hugging Face(F-Labs/Qwen3.5-0.8B-DynamicTune-Base)。
「研究」频道最新
- 主动式 LLM Agent 提出设计框架,23 种配置揭示信任断层 — minnesotanlp · 2026-10-06
- SearchJev 搜索决策提速 5 倍,校准误差最高降 74% — Congfeng Cao · 2026-10-06
- AI 自动研究发现更快分子优化器,力计算最多省 60% — Artem Tsypin · 2026-10-06
- ID-Forcing 测试时框架,让短视频模型生成分钟级长视频 — SeoulNatlUniv · 2026-10-06
- 研究揭示用自生成文本做测试时训练会系统性损害模型 — KAUST · 2026-10-06
- 300M 模型只学「非语言先验」,在上下文中学会学会语言 — Lennart Carstens-Behrens · 2026-10-06