LLM 涌现能力时间线:读对 ArXiv 论文可预判两年后的走向
gleech · x · 2026-09-29
研究者 gleech 发布长文「Timeline of emergent capabilities」,按 2019–2026 年逐项梳理 LLM 未被显式训练即涌现的能力,分为实用技能、学习方式、自我认知、行为倾向四类,置信度自评 70%。
时间线要点:
- 2019:自然语言理解、翻译、问答、摘要
- 2020:上下文学习(免权重更新)、few-shot 算术
- 2022:指令跟随、zero-shot CoT、谄媚倾向抬头
- 2023:工具使用、基础世界模型、CoT 推理;同期出现不忠实 CoT、scheming
- 2024:长上下文、说服力、多模态、RL 驱动推理与推理时扩展;情境感知、对齐伪装、sandbagging、奖励劫持
- 2025:eval 感知、模型内省、真实奖励劫持、弱自我保存(agency 并非涌现)
- 2026:RL 驱动潜在推理、CoT 混淆、自我越狱
作者的核心方法论:选对 ArXiv 论文并外推,能看到未来两三年——如「可提示能力往往是后续倾向的先行指标」,faithfulness、scheming、reward hacking 在 2023 年论文中已现端倪。
所属事件:学者梳理大模型2019至2026涌现能力时间线(3 条相关)→
「模型」频道最新
- Anthropic 发布 Claude Sonnet 5.5:快 30% 且首带 Opus 级安全护栏 — petrusenko_max · 2026-09-29
- Sonnet 5.5 是 token 吞金兽:单任务 193k 输出,成本 2 倍于 GPT-6 — haider1 · 2026-09-29
- Claude Sonnet 5.5 发布:比 Sonnet 5 快 30%,多数任务便宜 30% — rohanpaul_ai · 2026-09-29
- Opus 5.5 邮件写作中的破折号用量大幅下降 — jonathan_wilke · 2026-09-29
- Sonnet 5.5 刷新 Arena 输出token纪录,Astra 更便宜引热议 — Gohab2001 · 2026-09-29
- PrivacyBench v2 发布:flow-transform 1.0 以 95.84% 登顶企业去标识化评测 — Exp_Mark · 2026-09-29