研究用泰勒近似与谱密度跟踪大模型预训练损失
Sham Kakade预告了关于泰勒定理在深度学习中应用的ICML 2026报告。研究团队在1.5亿参数模型上,利用Lanczos quadrature计算完整谱密度,考察局部二次近似在大模型预训练过程中的准确度,并将在HILD workshop进一步探讨大模型谱密度分析的相关结构。
2026-07-09 ~ 2026-07-09 · 2 条相关
- 泰勒近似可跟踪预训练损失 — ShamKakade6 · 2026-07-09
- 大模型谱密度分析将继续展开 — ShamKakade6 · 2026-07-09