可学习子空间投影压缩 LLM:-70% 参数下 Llama-2-7B 仍胜强基线
Massimo Bini · hf · 2026-10-08
Hugging Face 新论文提出 Learnable Subspace Projections(LSP),改进神经网络低秩压缩方法。
- 现有低秩分解方法用局部闭式判据(激活能量、逐层重构误差等)选子空间,忽略误差随深度传播,高压缩率下性能崩溃;LSP 改为端到端学习每个线性层的正交投影子,以对稠密模型输出分布的 KL 散度等全局目标联合优化,预训练权重保持冻结。
- 投影子从白化 SVD 截断初始化,按每参数节省的输出 KL 分配秩;训练后可合并为标准低秩因子,注意力层还能用单个窄潜变量替代完整 KV cache。
- 结果:在 OPT-125M/1.3B、Qwen3-4B、Llama-2-7B 和 ViT-B/16 上全面超越基线,压缩率越高优势越大。70% 压缩下 Llama-2-7B 达到 10.9 WikiText-2 困惑度与 42.2% 零样本平均准确率(最强基线为 13.3 和 36.0%)。
- 分解后模型小 batch 解码最快提速 1.6 倍;共享潜变量缓存使 128k 上下文下权重+KV cache 总内存缩小 13.5 倍(无绑定的基线分解最多 6.5 倍)。
「Infra」频道最新
- Codex Cloud 默默上线 Tailscale 支持,连 Tailscale 自己都不知情 — pvncher · 2026-10-08
- 推理工程成 AI 关键技能:Prefill 与 Decode 的优化全解 — mikeflache · 2026-10-08
- NVIDIA Vera Rubin 路线图转向:AI 竞赛正变成基础设施竞赛 — mikeflache · 2026-10-08
- Cursor 用户 30 天烧 1.5T token,折算年账单或达 1.32 亿美元 — zeeg · 2026-10-08
- 开源 AI-SQL 引擎 Quail 上线 prefix sharing:token 省 3 倍、提速 2.6 倍 — sh_reya · 2026-10-08
- 从 SSD 流式加载专家:DeepSeek V4.1 在 Mac 上跑到近 40 tps — HankYeomans · 2026-10-08