0.8B 模型闭式权重手术跑赢 2B 模型,ARC-Challenge 达 42.15% 零反向传播
AdventurousTwo6445 · reddit · 2026-10-06
Reddit 用户发布 DynamicTune 方法:把深度网络视为连续深度动力系统,从大教师模型中提取速度场,通过闭式线性代数(SVD delta)迁移进学生模型,全程零反向传播、零训练 token,在 8GB AMD RX 580 消费级硬件上约 12 分钟完成。为消除本地评测偏差,作者将未量化 FP16 checkpoint 上传 Hugging Face,由 TPN Bench 在数据中心 NVIDIA L4 上用 lmeval 0.4.12 独立复测。ARC-Challenge 全量 1172 题(zero-shot、贪心解码)结果:
- 原版 Qwen3.5-0.8B Base:37.50%
- 25k Claude 推理对、3 epoch 多卡 SFT 蒸馏:38.10%
- 原版 Qwen3.5-2B Base(Q8):41.10%
- DynamicTune 权重手术版:42.15%,比原版 0.8B 提升 4.65%,Z 值 3.23σ(p<0.001)
关键细节:盲目对全部 24 层施加权重 delta 会导致 NLL 爆炸(+64.78%),作者计算各层表征残差的归一化香农谱熵来筛选可注入层——Layer 0 熵值 0.7138 最 receptive,中高层熵值接近 1 则跳过。作者声称高阶推理被直接压缩进边权重,0.8B 模型在硬科学推理上超过了 2.5 倍大的模型。结果仍属作者自述+第三方跑分,方法未见同行评审,但数据管线(公开 checkpoint、标准 eval 框架、协调器编号)提供了可核查性。
所属事件:闭式权重手术让 0.8B 模型跑赢 2B 模型(2 条相关)→
「模型」频道最新
- 德国小模型 Kolibri 成功用小众语言 Nim 写出可用命令行工具 — carlocapocasa · 2026-10-06
- PlurPO 方法缓解 AI 讨好型回复,有害意图背书降 89% — mmitchell_ai · 2026-10-06
- Claude 口音翻车祸及全生态:大规模蒸馏让各家模型一起变怪 — PMinervini · 2026-10-06
- 实测:Cognition SWE-2 在 Animation Bench 上胜过 Fable-5.1 等旗舰 — himanshustwts · 2026-10-06
- Mistral CEO 称新模型在部分领域超越中国模型 — tengo_harambe · 2026-10-06
- Grok 4.7 包揽 VulcanBench 前三,仓库级编程测试最高 93.15 分 — XFreeze · 2026-10-06