生成器远超验证器:DeepSeek-Coder 抽样 250 次解 56% 的启示
le_james94 · x · 2026-09-16
作者花了三周学习 Stanford Online 的 CS 329A 课程(Azalia Mirhoseini 与 Aakanksha Chowdhery 主讲),发现贯穿全部课程的一个核心论点:生成器的能力已远远跑在验证器前面。
他用数据佐证:DeepSeek-Coder-V2-Instruct 在 SWE-bench Lite 上单次采样只解决 15.9% 的问题,但抽 250 个样本后解决率达 56%——前提是有测试套件告诉你哪个样本是对的。也就是说,「模型这堆答案的均值在变好,但你伸手从这堆里挑出正确答案的能力并没有同步提升」。
作者随后分节复盘了课程内容,核心都围绕生成与验证的鸿沟这一主线。
所属事件:斯坦福CS329A开课:自我改进AI Agent九讲(5 条相关)→
「编程与Agent」频道最新
- Google API Gateway 现可作远程 MCP 服务器,零改动暴露 REST API — rseroter · 2026-09-16
- 把 Blender MCP 插件移植到 3.6 旧版,AI 一句话生成完整猫头鹰场景 — SpinachOk9137 · 2026-09-16
- Lyft 用 LangGraph/LangSmith 把客服 agent 交付周期从 6 个月缩到 1-2 周 — LangChain · 2026-09-16
- 纯文本状态喂给 AI Agent 玩《毁灭战士》,每秒 10 次决策成本约 7 美元/时 — hackgoofer · 2026-09-16
- 职业开发者发帖激辩:MCP 标准化工具层 vs 直接喂 REST API — Onmas · 2026-09-16
- 离职即失访问权:开发者痛失 5 年 commit 历史,无法用于训练个人 agent — DanielLockyer · 2026-09-16