LLM 剪枝是伪命题?研究称从头训练小模型反而更优

burny_tech · x · 2026-07-31

推文引发了一场关于大语言模型(LLM)结构化剪枝是否有效的技术探讨。

作者指出,如果在拥有充足训练 token 的前提下,从头开始训练一个较小的密集(dense)LLM,其效果能够媲美甚至超越对大模型进行结构化剪枝得到的模型。

他认为,粗粒度的深度或宽度剪枝实际上并没有实现“知识转移”,其本质更像是一种极其昂贵的神经网络架构搜索(NAS)。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →