0.8B 模型闭式权重手术跑赢 2B 模型,ARC-Challenge 达 42.15% 零反向传播

AdventurousTwo6445 · reddit · 2026-10-06

Reddit 用户发布 DynamicTune 方法:把深度网络视为连续深度动力系统,从大教师模型中提取速度场,通过闭式线性代数(SVD delta)迁移进学生模型,全程零反向传播、零训练 token,在 8GB AMD RX 580 消费级硬件上约 12 分钟完成。为消除本地评测偏差,作者将未量化 FP16 checkpoint 上传 Hugging Face,由 TPN Bench 在数据中心 NVIDIA L4 上用 lmeval 0.4.12 独立复测。ARC-Challenge 全量 1172 题(zero-shot、贪心解码)结果:

关键细节:盲目对全部 24 层施加权重 delta 会导致 NLL 爆炸(+64.78%),作者计算各层表征残差的归一化香农谱熵来筛选可注入层——Layer 0 熵值 0.7138 最 receptive,中高层熵值接近 1 则跳过。作者声称高阶推理被直接压缩进边权重,0.8B 模型在硬科学推理上超过了 2.5 倍大的模型。结果仍属作者自述+第三方跑分,方法未见同行评审,但数据管线(公开 checkpoint、标准 eval 框架、协调器编号)提供了可核查性。

所属事件:闭式权重手术让 0.8B 模型跑赢 2B 模型(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →