从 o1-preview 到数学超人类只用了两年,RL 突破人类级评测
jam3scampbell · x · 2026-09-09
开发者 jam3scampbell 指出,从 2024 年 9 月 o1-preview 在 AIME 上展现的 test-time scaling 趋势,到如今在一套开放数学难题评测集上达到超越人类的水平,只用了两年——RL 让模型突破人类上限早已是共识,但实时目睹仍然超现实。
他的核心论点:
- GPT-6 Astra 发布仅数天后,其「内部模型」就已再度实现代际跃升;
- 诚实地外推这条曲线,意味着在不太遥远的未来,模型将能完全自动化科学研究;
- 他呼吁人们真正内化这种进步速度,并采取相应的紧迫感。
「漫话AGI」频道最新
- 预测:大 AI 公司将收购大药企,目标不是药而是数据 — MannyKayy · 2026-09-09
- Futurism 起底 Alpha School:让学生戴心率监测器听 AI 点评作业 — benjaminjriley · 2026-09-09
- 博主断言 AI 最变革性变化尚未到来:百万模型实例足以冲击国家级经济 — scaling01 · 2026-09-09
- Anthropic 研究员 Jacob Coxon 宣布退出 AI:恐 2027 年自我改进失控 — rohanpaul_ai · 2026-09-09
- Anthropic 研究员 Jacob Coxon 宣布退出 AI:恐 2027 年自我改进失控 — rohanpaul_ai · 2026-09-09
- 「AI 技术投机者只是研究员流程的低方差复制品」引发争论 — MoonL88537 · 2026-09-09