SWE-bench 实测:250 次采样让 DeepSeek-Coder 通过率 15.9% 升至 56%
le_james94 · x · 2026-09-16
- DeepSeek-Coder-V2-Instruct 在 SWE-bench Lite 上单次采样仅解决 15.9% 的问题,采样 250 次后提升到 56%。
- 原因在于测试套件能告诉模型 250 个候选中哪个是对的——验证器免费时,重复采样就能大幅放大生成能力。
所属事件:斯坦福 CS329A 课程热传:验证器与自我改进 Agent 成核心议题(9 条相关)→
「研究」频道最新
- 前 OpenAI 高管新公司用 1300 张 H200 训出 Neon,材料分析胜 GPT-6 Astra — LiamFedus · 2026-09-16
- 谷歌 5390 万参数扩散模型让查询扩展提速 12-20 倍 — imjustnewatai · 2026-09-16
- 斯坦福论文:50 个样本即可评测音频大模型,HUMANS 基准开源 — stanfordnlp · 2026-09-16
- AI agents 耗百亿 token 攻坚 60 年未解的删除信道容量问题 — DimitrisPapail · 2026-09-16
- 学者呼吁顶会鼓励 AI 审计论文,壮大第三方审计生态 — dhadfieldmenell · 2026-09-16
- 贝叶斯优化研究者 Ruth Chew 离开 DSO 赴华盛顿大学读博 — PangWeiKoh · 2026-09-16