GPTs are GPTs: An Early Look at the Labor Market Impact Potential of Large Language Models
Tyna Eloundou, Sam Manning, Pamela Mishkin, Daniel Rock
econ.GN, cs.AI, cs.CY
2023-03-18
OpenAI与宾大用人工和GPT-4给O*NET近两万条任务打「能否提速一半」的暴露分。裸模型大约覆盖15%任务,配上软件升到47%–56%;约80%美国劳动者至少一成任务会碰到。
ChatGPT 刚上线那几个月,自动化文献还停在「例行体力活更容易被机器拿走」。Frey 与 Osborne 的职业淘汰概率、Felten 把 AI 能力对到 ONET 能力项、Webb 用专利文本对任务、Brynjolfsson 的「适不适合机器学习」(SML),测的都是更宽的机器学习或机器人,对不上一个能写代码、翻译、改稿的通用文本模型。
OpenAI 的 Eloundou、Manning、Mishkin 和宾大的 Rock 问得更窄:工人若用上接近 ChatGPT 或 Playground 的模型,再算上在它上面长出来的软件,美国职业里有多少任务能在同等质量下把耗时砍掉一半以上?他们不区分增强还是替代,也不给采用时间表。标题里的双关就是结论:GPT 模型长得像通用目的技术(general-purpose technology)。
数据底盘是 ONET 27.2:1,016 个职业、19,265 条任务、2,087 条详细工作活动(DWA)。工资和就业来自 BLS 2020–2021。
暴露的操作定义很硬:用上 LLM 或 LLM 软件后,完成该任务的时间至少减半,质量还要让第三方看不出来。达不到就算没暴露。评分分三档:
再合成三个职业分数:α 只计 E1,是下界;β = E1 + 0.5×E2,主结果,给配套创新打五折;ζ = E1 + E2,上界。核心任务权重是补充任务的两倍。
标注两路并行。人类这边,作者先标了大量样本,再让做过 GPT 对齐评审的标注员覆盖全部 DWA 和一部分任务。模型那边,早期 GPT-4 拿略改过的评分表给所有「任务×职业」对打分。人机在 ζ 上一致率 82.1%,Pearson 0.654;α 一致率也有 80.8%,但相关系数只有 0.223,说明「能不能直接用对话框」这件事两边经常打到同一档,档内深浅对不齐。
按 β,约 80% 美国劳动者所在职业至少 10% 任务被标成暴露,约 19% 劳动者所在职业超过一半任务暴露。只看现成语言和代码能力、不加软件,人类标注里只有 3% 劳动者过半任务暴露;把生成模型和配套工具算进去,这个比例可到 49%。任务层面,裸模型大约 15% 能显著加快;加上软件,人类 ζ 均值 0.47、GPT-4 为 0.56,和摘要里的 47%–56% 对得上。
| 口径 | 人类职业均值 | GPT-4 职业均值 | 含义 |
| α (仅 E1) | 0.14 | 0.14 | 打开对话框 |
| β (E1+0.5 E2) | 0.30 | 0.34 | 主结果 |
| ζ (E1+E2) | 0.46 | 0.55 | 软件全开 |
按职业数、任务等权:人类标出 2.3% 的职业 α 过半,21.6% 的职业 β 过半,47.3% 的职业 ζ 过半。人类把 15 个职业标成 ζ=100%,GPT-4 标了 86 个。
人类 β 最高的几类是调查研究人员 84.4%、作家 82.5%、口笔译 82.4%、公关 80.6%。ζ 顶格出现数学家、报税员、金融量化分析师、作家、网页与数字界面设计师。零暴露的 34 个职业几乎全是动手的:洗碗工、水泥工、屠宰分割、运动员、矿井支护工。
工资和暴露正相关,和就业规模几乎无关。这和以往「机器学习总体暴露」的画像相反:高薪认知岗更靠前。ONET 基本技能回归里,编程对 β 的系数 0.623、写作 0.467,科学 −0.230、批判性思维 −0.196。Job Zone 1(准备期三个月内、中位年薪约 3.0 万美元)人类 β 均值 0.06,过半暴露劳动者占比 0%;Zone 4(本科、约 7.7 万美元)β 均值 0.47,该占比 34.5%;Zone 5 略回落到 0.43 和 26.45%。学徒制岗位几乎没暴露(人类 β 0.04),不需要在岗培训的岗位 β 0.42。
行业上,信息处理、数据处理、医院偏高,制造、农业、采矿偏低。2012 年以来的生产率增速和暴露几乎不相关。论文把这解读成不太会加剧 Baumol 成本病:已经高增长的行业不会被 LLM 再单方面拉开。
跟旧指标比,Webb 的软件/AI、SML、常规认知任务都和本指标显著正相关;机器人、常规体力、Frey-Osborne 自动化概率是负相关。旧指标加工资控制能解释约 61%–73% 的方差,剩下 27%–39% 是这把 LLM 专用尺子多出来的。
能拿走的判断就一条:ChatGPT 对话框不是冲击的主体,套在上面的软件才是。α 到 ζ,任务暴露从大约 15% 跳到一半左右,配套软件的平均贡献可以超过裸模型的两倍。
第二件事,方向和机器人故事反着走。洗碗和砌墙几乎不动,写作、翻译、报税、量化分析排在最前面。如果公司只在客服和初级文员上试点,会漏掉论文里暴露最高的那一层。
第三,这是能力上界,不是就业预测。暴露被定义成「能提速一半」,明确不谈会不会裁员、何时采用。2023 年 8 月的工作底稿,E1 还按 GPT-3.5 来想;后面模型变强,这份表更接近下界。
论文自己列的窟窿够大。标注员熟悉模型、不熟悉各行各业,对陌生岗位的可靠性判断会偏。任务清单未必等于真实工作,默会技能、任务之间的先后依赖都会被切开。50% 时限是为了好标,作者也猜真实节省会更低。GPT-4 打分对提示词措辞敏感,所以人机两套分数并列,谁都不当唯一真值。研究只覆盖美国正规就业,不管自雇和灰色经济。α 里没有把 GPT-4 视觉算进去。人机卡壳的三类任务也写了:改习惯才能用上的会议谈判、规范要求人来拍板或共情的决策咨询、已经被别的软件自动化的事。
另外两处读起来要打折。不按任务重要性加权时,理发师这类职业会被抬上去,作者自己点名过。人类 β 主结果里 19% 劳动者过半暴露,ζ 口径下职业数是 47.3%、劳动者可达 49%,三个数经常被混用。标题说 GPTs are GPTs,通用目的技术的三条里,「持续改进」几乎是引用已有文献,「渗透」和「互补创新」才是这篇文章用任务评分撑起来的;采用率、全要素生产率和资本投入都没有测。