精读斯坦福CS329A九讲:生成器跑赢验证器
James Le 花 3 周读完 Stanford Online 在 YouTube 公开的 2025 秋季课程 CS329A「Self-Improving AI Agents」,由 Azalia Mirhoseini(前 Google)与 Aakanksha Chowdhery 主讲,共九讲,并逐讲撰写长文复盘。这一系列笔记值得关注的理由是:它把当前 AI 能力格局的核心矛盾——生成器与验证器的差距——系统化了。
已确认
- 课程核心论点是生成器的能力已远远跑在验证器前面,这是贯穿全部九讲的线索。
- 以 DeepSeek-Coder 抽样 250 次可解出 56% 的题目为例,说明大量生成样本能突破单次验证能力,生成-验证不对称愈发明显。
- DeepSeekMath-V2 的做法是把验证从约束变成产品:先训练验证器,再随生成器进步持续扩展验证算力,让验证始终领先一步;但这条路在数学之外是否成立,作者坦言无人知晓。
- AI 能力测量正分裂为两条线:METR 评测显示 o3 的 50% 时间视界约相当于 110 分钟人类工作量,大约每 7 个月翻倍;而在 DeepScholar 类文献综述评测中,没有一个系统超过 31% 的得分。
为什么重要
- 若生成持续跑赢验证,研究重心将转向「如何扩展验证算力」,验证器可能成为新的竞争焦点与产品形态。
- 时间视界翻倍的长程任务叙事与具体任务(如文献综述)的低得分并存,说明单一基准已不足以描述 AI 能力,评测体系本身正在分化。
2026-09-16 ~ 2026-09-16 · 5 条相关
一手来源
- 斯坦福 CS329A 开课:自我改进 AI Agent 的 9 讲课程 — le_james94 ·
- 3 周精读斯坦福 CS329A 九讲:生成器已跑赢验证器 — le_james94 ·
- o3 时间视界约 110 分钟,但写文献综述无一系统超 31% 分 — le_james94 ·
- 【源头】斯坦福 CS329A 开课:自我改进 AI Agent 的 9 讲课程 — le_james94 · 2026-09-16
- 生成器远超验证器:DeepSeek-Coder 抽样 250 次解 56% 的启示 — le_james94 · 2026-09-16
- 【源头】o3 时间视界约 110 分钟,但写文献综述无一系统超 31% 分 — le_james94 · 2026-09-16
- DeepSeekMath-V2 把验证做成产品:验证算力随生成器一起扩展 — le_james94 · 2026-09-16
- 【源头】3 周精读斯坦福 CS329A 九讲:生成器已跑赢验证器 — le_james94 · 2026-09-16