从监督学习到 agentic world modeling 的完整路线图
cwolferesearch · x · 2026-07-25
从监督学习一路拼到 agentic world modeling
这条帖把训练 LLM 的几种目标串成了一条清晰链路:从 监督学习 / SFT 到 RL,再到 agentic RL,最后落到一个统一的 agentic world modeling 目标。
- 监督学习:用交叉熵做 next-token prediction,直接拟合数据里的真实下一个 token。
- RL:让模型基于自己采样的输出学习,奖励来自 verifier 或 reward model,再用 PPO / GRPO 这类 policy gradient 更新。
- Agentic RL:把 RL 扩展到多步 agent,模型会反复生成动作、调用工具、接收环境反馈;训练时只对动作 token 计算 RL loss,并把环境 observation 等非生成 token mask 掉。
- Agentic world modeling:把监督学习和(agentic)RL 合并到一个目标里。
- 动作 token 用 advantage-weighted RL loss。
- observation token 用一个小的正监督权重,退化回 next-token prediction。
作者的核心观点是:这种混合目标能同时教会模型 如何行动 和 世界会如何响应,让 agent 的决策能力和内部世界模拟一起提升。
所属事件:梳理大模型迈向世界模型的训练演进路线(2 条相关)→
「编程与Agent」频道最新
- 有人用 Claude Opus 5 做了个角斗场街机格斗游戏 — chrisfirst · 2026-07-25
- Ax 用 DSPy signatures 拼出 RLM agent,不靠 graph 或 loop — dosco · 2026-07-25
- 让 AI agents 写大部分代码时,如何避免发出烂活 — PuzzleheadedMenu2454 · 2026-07-25
- HarnessRouter 推出单 API 接入应用的 AI Agent 后端 — ycombinator · 2026-07-25
- 作者公开如何用 Claude Opus 5 搭建 AI 研究引擎 — eptwts · 2026-07-25
- OpenHands 社区更新:加入 Kimi Code 支持与自托管修复 — rajistics · 2026-07-25