经济学家如何参与 AI 后训练时代的技术演进
ethayarajh · x · 2026-08-22
Sachin.ethayarajh 分享了向年轻经济学家介绍后训练的演讲幻灯片。他指出,现在训练自己的模型比以往任何时候都更可行,经济学家和社会科学家可以在后训练的下一个时代发挥重要作用。
后训练套件主要包括:
- SFT(有监督微调)
- 离线方法(DPO/KTO/SimPO 等)
- 在线方法(PPO/GRPO/CISPO 等)
- RL 环境
- 蒸馏(当前阶段)
- 世界适应(未来方向)
随着智能体在现实世界部署,现实世界也会适应它们。目前的范式往往忽略了这种适应性,因为处理来自静态环境的可验证奖励更简单、可扩展。不应假设现实世界保持不变,世界适应是未来的关键。
「漫话AGI」频道最新
- TIME 文章:形式化是应对 Vibe Coding 的解药 — soumitrashukla9 · 2026-08-22
- 美国电工工会呼吁建设更多数据中心 — Polymarket · 2026-08-22
- 超智能被喻为西方技术巅峰,将引领人类跨越星系 — SydSteyerhart · 2026-08-22
- 观点:21 世纪通往权力的关键在于数据中心凭证 — curious_vii · 2026-08-22
- 科技演变史:从核能到人类文明可能分化 — Dr_Singularity · 2026-08-22
- Astra 的讨论焦点转向遏制与自主能力 — VraserX · 2026-08-22