Liam Fedus 回顾 Scaling Laws:算力即智能
hsu_byron · x · 2026-08-20
Liam Fedus 转发了 Jie Tang 关于 Scaling Laws 的文章,并补充了 2020 年探索 Switch Transformer 稀疏性的历史细节。当时团队将每个 token 路由到 2048 个专家中的 1 个,模型总参数达 1.6T(对标前沿模型),但激活参数不足 3B。该模型在 TriviaQA 上刷新 SOTA 且计算效率极高,但在 SuperGLUE 等推理任务上表现不佳。Fedus 总结称,最优的 token-per-parameter 比例高度依赖任务,或者如 Noam Shazeer 所直觉的那样:FLOPs 是智能,参数是知识。
所属事件:智谱唐杰长文谈Scaling Law:GLM-5.3同参数仅靠后训练提升(9 条相关)→
「研究」频道最新
- TRACES 基准评测 AI 科学发现能力,要求无解问题推演 — alifcoder · 2026-08-20
- 模型理解语言需内部建模时空,能力涌现早于预期 — RexDouglass · 2026-08-20
- EurAI 2025 博士论文奖:表彰探索 LLM 语言结构的研究 — banazir · 2026-08-20
- 开源项目将全球城市转化为图神经网络模型 — aigleeson · 2026-08-20
- H3TiledLoopSpaceTime 展示基于 H3 的时空视频生成 — DuHal9000 · 2026-08-20
- 谱神经元提出可扩展且可解释的新型 ML 原语 — alexsht1 · 2026-08-20