从 Chinchilla 到 GPT-3:一条线程讲透改变行业的 AI 论文
thisdudelikesAI · x · 2026-09-12
作者连载梳理重塑 AI 行业的里程碑论文:
- GPT-3(《Language Models are Few-Shot Learners》, Brown et al., 2020):1750 亿参数,比此前最大非稀疏模型大 10 倍。核心发现是仅靠规模扩大就解锁了上下文学习(in-context learning)——无需微调、不做梯度更新,只在提示里给几个示例即可完成任务,某些场景甚至媲美此前需要大量标注数据微调的 SOTA 方法。Few-shot prompting 由此诞生。
- Chinchilla(《Training Compute-Optimal LLMs》, Hoffmann et al., 2022):修正了 Kaplan 的 scaling 定律,指出当时多数大模型严重欠训练,经验法则是每个参数约配 20 个训练 token,这重新定义了业界如何分配算力。
该线程仍在此前条目基础上继续更新,适合作为经典论文入门清单。
「模型」频道最新
- 模型为何宁引两年前的论坛帖也不引官方文档 — OtherwiseSection7795 · 2026-09-12
- 开发者实测:GLM 3.8-27B 质量碾压同级,还省 22-33% token — JLeonsarmiento · 2026-09-12
- DeepSeek灰度测语音,OpenAI智能体涉攻击RubyGems窃凭证 — 快鲤鱼 · 2026-09-12
- 网友:开源模型持续变小,能力复制没那么难也不远 — menhguin · 2026-09-12
- 同一提示实测三家模型:银河系碰撞模拟 Opus 5 力压 GPT-6 Astra — Fleischkluetensuppe · 2026-09-12
- 用户发现 Claude 项目隔离失效:能说出其他项目里的专属内容 — MaterialDurian2836 · 2026-09-12