OpenAI 前研究副总裁:自动化 AI 研究的核心是测试时算力

agihouse_org · x · 2026-07-27

这篇内容整理了 Jerry Tworek 的一次技术分享。Jerry 曾在 OpenAI 负责 Codex、reasoning models 和 reinforcement learning,也参与了 HumanEval 的创建;现在他是 Core Automation 的 CEO。

核心观点

为什么静态 benchmark 会失效

当某个 benchmark 成为行业焦点后,模型分数会越来越像“对测试题的适配程度”,而不只是能力本身。

他认为的下一步

Jerry 现在更看好 自动化 AI 实验室:系统能自己提出想法、运行实验、调用工具,并通过真实反馈循环持续改进。

帖子里的幻灯片也强调,autoresearch 本质上是在扩展 test-time compute;未来方向包括更多探索/多样性、更强的“做研究”模型,以及可能出现的 test-time training。

原文链接 →

「公司和人」频道最新

更多「公司和人」频道 AI 资讯 →