GPT-6 对实证经济学提升有限,研究者称进入“九的行军”

soumitrashukla9 · x · 2026-09-09

多位经济学研究者分享对 GPT-6 的初步体验。Chris Blattman 认为有一代际提升但幅度很小,约相当于 5.5 Codex 到 5.5 ChatGPT Pro 的差别,偶尔值得用一次,谈不上戏剧性进步。

Yanagizawa 在 Project APE 的关键基准上看到类似结论:从 99% 提升到 99.5%——他称之为“九的行军”(march of nines)的开始:表面跳变不大,但在逼近饱和的指标上每前进一个九都意味着错误率大幅下降。

所属事件:经济学家实测GPT-6:代际提升微弱几乎无人察觉(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →