唐杰谈 scaling 演进:FLOPs 是智能,参数是知识
cedric_chee · x · 2026-08-21
唐杰(@jietang)转发并点评了一段关于 scaling laws 历史的讨论。Liam Fedus 回顾 2020 年的 Switch Transformers:模型仅激活不到 3B 参数,总参数却有 1.6T(与今天的前沿模型相当),在 C4 困惑度上以远少于 T5 的算力取得更好成绩,并在 TriviaQA 创下 SOTA,但在 SuperGLUE 等推理任务上表现很差。
核心教训是最优的 tokens-per-parameter 比值高度依赖任务,正如 Shazeer 的直觉:FLOPs 是智能,参数是知识。
「模型」频道最新
- DeepSeek 推出 V4 多模态实验版,代理能力逼近 Opus-4.8 — teortaxesTex · 2026-08-21
- DeepSeek V4 视觉模型上线,主打极速与低价 — teortaxesTex · 2026-08-21
- Qwen3.8 27B 推出 Blackwell 原生 NVFP4 量化版本,速度提升 50% — ionsago · 2026-08-21
- DeepSeek 发布 V4-Flash-Vision-Exp,多模态 Agent 能力逼近 Opus 4.8 — deepseek_ai · 2026-08-21
- MIMO V3 基准测试曝光,Pro 版接近 Fable 水平 — teortaxesTex · 2026-08-21
- 曝 GLM-5.4 借助 RL 快速进化,实测超越 GPT — kimmonismus · 2026-08-21