BCG 实测 GPT-4:边界内提速 25%、质量涨 40%,越界任务错误率反升 19 个点

2026-08-02

758 名 BCG 顾问的对照实验显示,GPT-4 在能力边界内让任务快 25%、质量涨 40%,但在边界外把错误率抬高 19 个百分点,且错误答案被包装得更专业。

这篇在解决什么

2023 年 ChatGPT 火起来后,企业最焦虑的一个问题没人答得准:把 GPT-4 交给高端知识工作者,到底是涨生产力还是埋雷?此前大部分证据来自实验室题库或自我报告问卷,没有人在真实咨询公司里跑过严格对照实验。哈佛商学院和波士顿咨询(BCG)合作,把这件事搬进 BCG 内部实地测了一遍。

方法

758 名 BCG 顾问参加,约占 BCG 个人贡献者级别顾问的 7%。先做一道基线题给每个人定能力锚点,再随机分进三组:无 AI、可用 GPT-4、可用 GPT-4 且先上一堂提示工程(prompt engineering)速成课。题目分两套。第一套 18 道真实咨询任务,覆盖创意、分析、写作、判断,刻意设计在 GPT-4 当时能力范围内,论文称为「前沿之内」。第二套只有一道,是一道精心调过的商业案例:表面看电子表格数据就够下结论,但只有仔细读访谈记录里的隐性线索才能答对,GPT-4 直接做会做错,论文称为「前沿之外」。所有产出由人独立盲打分。

结果

18 道「前沿之内」任务上,用 AI 的顾问全面领先:多完成 12.2% 的任务,快 25.1%,质量分高 40% 以上。收益分布最反常识的一点是,能力在平均线下的顾问涨 43%,平均线上的只涨 17%,AI 把高低差距明显拉平了。

「前沿之外」那一道题翻车了。无 AI 组 84.5% 答对,用 AI 的两组分别只有 60% 和 70% 答对,平均低 19 个百分点。更危险的是第二层结果:即便答错了,用 AI 的顾问那份错误答案,按 1 到 10 分打下来质量分反而更高。换句话说,AI 把错误结论包装得更像一份专业的咨询建议。

为什么重要

这篇第一次用严格实验把「AI 既放大也削弱高端知识工作」这件事钉死。对企业,结论不是该不该用,而是要分清在哪道题上用:能力边界内的活放心交,越界的活交出去等于把判断权让给一个会自信犯错的东西。对个人,能力越低增益越大,这是少有的能压缩技能差距的工具。

局限与存疑

样本只有一家咨询公司、一类知识工作,能不能推到工程师、律师、医生是开放的。用的是 2023 年 5 月那个 GPT-4 快照,模型换一代结论可能变。「前沿之外」只有一道题,单个任务就定生死,统计上单薄。作者还自曝一个尴尬结果:那堂提示工程速成课非但没让人更会判别,反而提高了把 GPT 输出原样复制进答案的比例,论文称之为 retainment,等于教完之后人更不愿意动脑。表现差的人有一个共性,就是「不 engage 地照抄」,论文叫 unengaged interaction。

术语

原文与代码

社区讨论

全部论文解读