斯坦福团队提出「相对缩放定律」:缩放并非万能均衡器
Diyi_Yang · x · 2026-10-07
斯坦福 William B. Held、Percy Liang、Diyi Yang 等人在 COLM 2026 展示海报论文《Relative Scaling Laws for LLMs》。
- 核心思路:传统 scaling law 只看总体误差,而该工作追踪不同测试分布之间的性能差距如何随规模演化。
- 实验:在 3×10^18–3×10^20 FLOPs 的等算力(IsoFLOP)预算下训练 255 个 decoder-only Transformer。
- 发现:MMLU 学术领域随规模趋向均等;地区英语方言的走向取决于人口规模;AI 风险行为聚类出现分化——能力与影响力相关风险在预训练中上升,而对抗性风险不升。
- 结论:缩放能提升整体性能,但不是普适的均衡器。团队开源了全部模型检查点供研究者复用。
「研究」频道最新
- OpenAI 证明矩阵乘法可降至 O(n^2.25),但尚无具体算法 — Pascallisch · 2026-10-07
- Melanie Mitchell 回击 Scott Alexander:晒 Google Scholar 与 NeurIPS 新论文 — MelMitchell1 · 2026-10-07
- 整数乘法再快于 N log N?算法圈惊呼「太邪门」 — QuintinPope5 · 2026-10-07
- OpenAI 研究员惊讶:AI 实验室数学新成果至今没查出硬伤 — willdepue · 2026-10-07
- 前沿 LLM 做生物「人类解读者」比虚拟细胞更先落地 — CatAstro_Piyush · 2026-10-07
- AI 宣称攻克 500 大开放数学难题中的 90 个,黎曼猜想等获部分证明 — DavidSKrueger · 2026-10-07