从 Kaggle 冠军到 ULMFiT:Jeremy Howard 如何改写语言模型训练范式
bigaiguy · x · 2026-10-06
一条长推回顾了 Jeremy Howard 的经历,称他在 2018 年初证明当时训练语言模型的方式是「反的」,数月内 OpenAI 与 Google 便基于同一思路做出突破性模型。
- 他生于澳大利亚,学哲学出身,做过管理咨询,联合创办邮箱服务 Fastmail;后进入数据科学,成为 Kaggle 排名第一的参赛者,并出任 Kaggle 总裁兼首席科学家;创办 Enlitic,把深度学习用于医学影像。
- 2016 年与 Rachel Thomas 创办 fast.ai,主张无需博士学历或数据中心也能做严肃深度学习;免费课程 Practical Deep Learning for Coders 从第一课就教人构建真实模型,数千名学生借此转行。
- 2018 年 1 月与 Sebastian Ruder 发表 ULMFiT:先在大规模通用文本上预训练语言模型,再针对具体任务微调。迁移学习在计算机视觉中已是标配,但在文本上此前无人稳定实现。ULMFiT 在多数测试数据集上把错误率降低 18%–24%;仅用 100 条标注样本,就能追平用 100 倍数据从头训练的模型。
- OpenAI 于 2018 年 6 月发布 GPT-1,Google 于同年 10 月发布 BERT,都建立在「大规模预训练 + 微调」这一配方之上,该配方成为整个领域的基础。
- 2023 年他与 Eric Ries 联合创办 Answer AI;2024 年该实验室与 Tim Dettmers 合作,使在消费级 GPU 上训练超大模型成为可能;他还提出 llms.txt,帮助网站与语言模型「对话」。
他的课程免费、库开源。作者总结:现代语言 AI 最具影响力的想法,来自一位主业是教别人怎么用它的人。
「公司和人」频道最新
- 爆料称 Anthropic 曾向多位知名概率论学者开出 NDA+报酬挖角遭拒 — ctjlewis · 2026-10-06
- Sam Altman:「超级智能」比人工智能更准确地描述当下 — 4KTV · 2026-10-06
- 从 LLVM 到 Mojo:Chris Lattner 25 年持续重建编译器底座 — thisdudelikesAI · 2026-10-06
- OpenAI 被指状态紧绷如困兽,高管以「涉及安全」拒评内部动向 — CtrlAltDwayne · 2026-10-06
- 金管局质问汇丰:AI 枢纽为何落户新加坡而非香港 — AIFlow_ML · 2026-10-06
- Sakana AI 社长伊藤:AI 竞争优势正从单模型转向系统编排力 — SakanaAILabs · 2026-10-06