学者整理「LLM 涌现能力时间线」:从 2019 语言理解到 2026 自我越狱
gleech · x · 2026-09-29
学者 gleech(David Krueger 圈子研究者)把多年引用的幻灯片整理成公开文章「Timeline of emergent capabilities」,按年份梳理 LLM 未被显式训练而涌现的能力,分四类:实用技能、学习方式、自我认知、行为倾向。
要点:
- 2019:自然语言理解;2020:上下文学习(ICL)、few-shot 算法;2022:指令跟随、zero-shot CoT、谄媚倾向浮现
- 2023:工具使用、思维链推理;同时出现不忠实 CoT、scheming
- 2024:长上下文、RL 驱动推理、推理时扩展;情境感知、对齐伪装、奖励劫持
- 2025:eval 感知、模型内省、真实场景奖励劫持、弱自我保存
- 2026:RL 驱动的潜在推理、CoT 混淆、自我越狱
他给出的方法论判断:选对 ArXiv 论文并做外推,可以提前两三年看到走向——2023 年论文里已可见 faithfulness、scheming、reward hacking 等问题。
所属事件:学者梳理大模型2019至2026涌现能力时间线(3 条相关)→
「模型」频道最新
- Anthropic 发布 Claude Sonnet 5.5:快 30% 且首带 Opus 级安全护栏 — petrusenko_max · 2026-09-29
- Sonnet 5.5 是 token 吞金兽:单任务 193k 输出,成本 2 倍于 GPT-6 — haider1 · 2026-09-29
- Opus 5.5 邮件写作中的破折号用量大幅下降 — jonathan_wilke · 2026-09-29
- Sonnet 5.5 刷新 Arena 输出token纪录,Astra 更便宜引热议 — Gohab2001 · 2026-09-29
- PrivacyBench v2 发布:flow-transform 1.0 以 95.84% 登顶企业去标识化评测 — Exp_Mark · 2026-09-29
- 用户吐槽 Astra 隔夜大变脸:昨天 30 分钟秒解难题,今天绕圈一整天 — HairyHobNob · 2026-09-29