3 周精读斯坦福 CS329A 九讲:生成器已跑赢验证器
le_james94 · x · 2026-09-16
James Le 花 3 周读完 Stanford CS329A「Self-Improving AI Agents」全部九讲(授课者:Azalia Mirhoseini、Aakanksha Chowdhery),并逐讲写了长文复盘。
- 核心论点贯穿全课程:生成器已经跑赢验证器——生成候选方案的能力远超验证它们的能力,这是 agent 研究大部分难题所在。
- METR 图表:AI agent 能独立完成的任务时长每 7 个月翻倍(从 GPT-2 到 Claude 3.7 Sonnet),但按 80% 可靠性折算后任务时长大幅缩水——两条线之间的距离就是研究的硬问题。
- 自我改进的本质是同一个循环:生成候选 → 用单元测试/奖励模型/LLM/人来验证 → 筛选幸存者或在其上训练 → 再来一轮。
- 重点推荐 Lecture 9:DeepSeekMath-V2 把验证从约束变成产品——训练一个验证器,并随生成器提升而扩展验证算力;能否推广到数学之外的领域(法律推理、实验设计、无法单元测试的大型代码库)仍是未知数。
- 讲次覆盖:测试时算力扩展、鲁棒验证、工具与代码反馈学习、规划与多步推理、训练期 RL 扩展、搜索与深度研究 agent、agentic 评测与长程任务、未来研究方向。
「编程与Agent」频道最新
- Google API Gateway 现可作远程 MCP 服务器,零改动暴露 REST API — rseroter · 2026-09-16
- 把 Blender MCP 插件移植到 3.6 旧版,AI 一句话生成完整猫头鹰场景 — SpinachOk9137 · 2026-09-16
- Lyft 用 LangGraph/LangSmith 把客服 agent 交付周期从 6 个月缩到 1-2 周 — LangChain · 2026-09-16
- 纯文本状态喂给 AI Agent 玩《毁灭战士》,每秒 10 次决策成本约 7 美元/时 — hackgoofer · 2026-09-16
- 职业开发者发帖激辩:MCP 标准化工具层 vs 直接喂 REST API — Onmas · 2026-09-16
- 离职即失访问权:开发者痛失 5 年 commit 历史,无法用于训练个人 agent — DanielLockyer · 2026-09-16