原给初级员工的工作 Opus 5.5 几分钟做完,实测正确率超 95%

TraditionalHome8852 · reddit · 2026-09-30

Reddit 用户以一线使用视角回顾模型能力爬升:去年 12 月 GPT-5.2 在 71% 的任务上追平或胜过行业从业者(GDPval),4 月 GPT-5.5 升至 85%、Opus 4.7 达 80%;随后 OpenAI 悄悄停发自家人工评分的数字(作者排除了 AI 评分的 artificial analysis GDPval-AA v2.1)。

作者的一线观察:

作者的观点是「常态偏误」:每代模型只是比上代进步一步,没人意识到累计走了多远。期待后续模型在更多更难的领域达到同样水平。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →