OpenAI 前研究副总裁:自动化 AI 研究的核心是测试时算力
agihouse_org · x · 2026-07-27
这篇内容整理了 Jerry Tworek 的一次技术分享。Jerry 曾在 OpenAI 负责 Codex、reasoning models 和 reinforcement learning,也参与了 HumanEval 的创建;现在他是 Core Automation 的 CEO。
核心观点
- 代码是最早的“严肃 LLM 赛道”,因为它的正确性很容易验证:程序能否运行、测试能否通过,一眼就能看出来。
- HumanEval 的意义在于给模型进展提供了一个清晰、可检验的信号。
- Jerry 说的 “评估时代结束了” 不是反对评估,而是提醒:一旦基准变得重要,实验室就会围绕它训练、调参,直到它被“打穿”。
为什么静态 benchmark 会失效
当某个 benchmark 成为行业焦点后,模型分数会越来越像“对测试题的适配程度”,而不只是能力本身。
他认为的下一步
Jerry 现在更看好 自动化 AI 实验室:系统能自己提出想法、运行实验、调用工具,并通过真实反馈循环持续改进。
帖子里的幻灯片也强调,autoresearch 本质上是在扩展 test-time compute;未来方向包括更多探索/多样性、更强的“做研究”模型,以及可能出现的 test-time training。
「公司和人」频道最新
- Atlas Discovery 公开亮相,主打药物反应预测 — garrytan · 2026-07-27
- AMD 与 Anthropic 达成 2GW MI450 合作,AMD 最多投资 50 亿美元 — thione · 2026-07-27
- Cognition 低九位数收购 Poke,给 Devin 补上人格化能力 — thione · 2026-07-27
- Jensen Huang 公开反对把模型只留给少数人 — Hesamation · 2026-07-27
- Bayesian Health 拿下首个持续脓毒症监测 FDA 批准 — import_jmr · 2026-07-27
- Bayesian Health 的败血症 AI 成为首个 FDA 持续监测批准产品 — import_jmr · 2026-07-27