OpenAI 一天产出 722 篇数学论文,判断哪些工作先被 AI 自动化
ziv_ravid · x · 2026-10-07
作者观察到 OpenAI 一天内发布了 722 篇数学论文:一个内部模型尝试约 4000 道题,每道题约 3 小时 Pro 级推理。他据此提出一个判断 AI 自动化顺序的框架:
核心逻辑:自动化速度与质量 ∝ 结论数量与验证难度的反比。数学结构化、易验证,所以最先被攻克;其后依次是依赖噪声测量和实验的硬科学、会自适应的非平稳市场、高风险且信息碎片化的医学、语言模糊且规范多变的法律;艺术、文化、领导力最后。
对编码的判断(与主流不同)
- 编码中「类数学」的部分确实接近解决:靠 test-time compute 大量尝试、保留可验证的结果。运行时优化同理——更快吗?输出一致吗?都可测量。所以模型已经或很快能在系统与内核代码优化上达到超人水平
- 但「无 bug 软件」不会很快到来:一旦涉及真实用户,状态的熵是根本问题——用户复杂、难预测,无法像数学那样形式化验证。这部分编码在自动化排序上更接近医学和法律,而不是数学
结论:在学会对真实用户行为做验证之前,bug 会一直存在,编码不会复制数学式的跃升。
所属事件:OpenAI 开源前沿模型 722 份新数学成果手稿(121 条相关)→
「漫话AGI」频道最新
- AI 风险话语的极化:有人活成了自己害怕的权力寻求者 — foundjuliette · 2026-10-07
- 「下一个爱因斯坦」答案揭晓:将是 OpenAI 或 Anthropic 的模型版本 — clemnt · 2026-10-07
- Cohere 研究:AI 尚未影响近半数职业,发布 ATE 数据集解析 — Cohere_Labs · 2026-10-07
- 数学博士生的自嘲:挥镰刀对抗百万台自动驾驶收割机 — FlorianGallwitz · 2026-10-07
- 开发者观察:人机产出正退化为 agent 之间的数据包 — aloncarmel · 2026-10-07
- 诺奖得主 Acemoglu:让 100 人提效 5% 比裁掉 5% 划算得多 — cen6wkf · 2026-10-07