GPT-6 对实证经济学提升有限,研究者称进入“九的行军”
soumitrashukla9 · x · 2026-09-09
多位经济学研究者分享对 GPT-6 的初步体验。Chris Blattman 认为有一代际提升但幅度很小,约相当于 5.5 Codex 到 5.5 ChatGPT Pro 的差别,偶尔值得用一次,谈不上戏剧性进步。
Yanagizawa 在 Project APE 的关键基准上看到类似结论:从 99% 提升到 99.5%——他称之为“九的行军”(march of nines)的开始:表面跳变不大,但在逼近饱和的指标上每前进一个九都意味着错误率大幅下降。
所属事件:经济学家实测GPT-6:代际提升微弱几乎无人察觉(2 条相关)→
「模型」频道最新
- GPT-6 Astra 登顶 RSI-Exam,超 GPT-5.6 达 18.4% — HuaxiuYaoML · 2026-09-09
- APEX-Agents 1.1 更新基准:Claude Fable 5.1 以 68.6% 居首 — amaarora · 2026-09-09
- 评论:前沿模型订阅必然「缩水通胀」,逼你升级到 API 付费 — StewartalsopIII · 2026-09-09
- 用户实测:高峰定价翻倍后,252M 缓存 token 一天只花 $0.75 — teortaxesTex · 2026-09-09
- 实测对比:Astra 长线程表现明显逊于 Sol,易跑偏失稳 — jdjohnson · 2026-09-09
- VC communism 时代落幕,前沿模型开始配给制,VC 求选模型心法 — StewartalsopIII · 2026-09-09