原给初级员工的工作 Opus 5.5 几分钟做完,实测正确率超 95%
TraditionalHome8852 · reddit · 2026-09-30
Reddit 用户以一线使用视角回顾模型能力爬升:去年 12 月 GPT-5.2 在 71% 的任务上追平或胜过行业从业者(GDPval),4 月 GPT-5.5 升至 85%、Opus 4.7 达 80%;随后 OpenAI 悄悄停发自家人工评分的数字(作者排除了 AI 评分的 artificial analysis GDPval-AA v2.1)。
作者的一线观察:
- 以前交给初级同事的工作,现在交给 Opus 5.5 几分钟完成、错误极少;按其 review 记录,正确率 95% 以上。
- 自己已几乎不再从零构建,工作流变成「描述需求 → 模型产出 → 审核」。
- 承认这些是 well-scoped 任务而非完整岗位,但它们占日常工作很大一块。
作者的观点是「常态偏误」:每代模型只是比上代进步一步,没人意识到累计走了多远。期待后续模型在更多更难的领域达到同样水平。
「漫话AGI」频道最新
- 从 B2B 到 A2A:当 AI agent 替人类做采购调研,网站准备好了吗 — Sales_mind · 2026-09-30
- 《Vector Media》新书提出"神经交换价值",解构生成式AI迷思 — round · 2026-09-30
- 三位伯克利校友揭秘如何拿到 DeepMind、Cursor、Thinking Machines offer — miniapeur · 2026-09-30
- 拒绝“迎合模型”的科研游戏:科学的意义在于满足自己的好奇心 — aran_nayebi · 2026-09-30
- AI 实验室承认数学难题枯竭,数学能力或很快停滞 — tak3sh8 · 2026-09-30
- CV 大佬 Michael Black 提议:为「用前沿模型解题」设论文新轨 — Michael_J_Black · 2026-09-30