Supervised Fine-Tuning vs. In-Context Learning: An Equilibrium Analysis of LLM Personalization under Congestion
Fengzhuo Zhang, Zhuoran Yang, Dirk Bergemann
cs.LG, econ.TH, stat.ML
2026-07-16
Yale 用线性模型给出 SFT 赢过 ICL 的覆盖阈值;共享 GPU 拥塞会翻转排序,同时提供两种方法不降低平台最大利润。
要把通用 LLM 接到自己的任务上,常见只有两条路:把示范塞进 prompt,做 In-Context Learning(ICL,上下文学习);或者用私有数据做 Supervised Fine-Tuning(SFT,监督微调)。SFT 更吃 GPU,ICL 更轻,适应范围也更窄。平台上大量用户同时个性化,一个人选 SFT,别人的等待就会变长。
现有 LLM 经济学多半停在 token 计价或缩放律,不怎么区分这两种算法在统计上差在哪。Yale 的 Fengzhuo Zhang、Zhuoran Yang、Dirk Bergemann 把线性回归当成 LLM 行为的代理,再嵌进连续统拥塞博弈,问三件事:没有拥塞时该选谁;共享算力时均衡长什么样;平台该不该同时卖两种个性化。
预训练被写成线性回归:每个样本可以来自不同的隐任务,模型学到一个高斯先验。个性化数据则共享同一个目标任务。
ICL 被当成在这个先验上的贝叶斯更新。它只在先验撑得住的子空间里改信念;预训练没覆盖到的方向,目标会被投影回去,误差里留下一块消不掉的任务方差。SFT 是以预训练参数为中心的正则化估计,λ 管住别跑太远。λ=0 就退化成只看个性化数据的最小二乘;λ 趋向无穷则钉死在预训练点上。SFT 能改整个参数空间,包括模型没见过的方向。
用户成本拆成两块:预测误差,加上「每样本资源消耗 × (单价 p + 拥塞等待)」。SFT 的每样本资源大于 ICL。人口做成连续统,每人选算法和样本量,总体资源需求 R 必须等于大家真正要走的资源。平台作为 Stackelberg 领导者先定 p,再按利润 (p−1)R 收钱,其中 1 是归一化的单位算力成本。
比较两者时加了谱对齐和各向同性假设,把误差拆成 d 个独立一维问题。覆盖系数写成 r/(d−r),r 是预训练覆盖的有效维,d 是任务本征维;未覆盖子空间的信噪比 κ = sτ/(2σ̃²)。
Proposition 3.6 给出门槛:最优正则的 SFT 误差不超过 ICL,当且仅当覆盖系数不低于由 κ 决定的临界值 Rcrit。κ≥1 时,SFT 在任意正覆盖下都严格更优;0<κ<1 时,SFT 要覆盖够大才赢。ICL 能赢,是因为它在未覆盖方向上选择不学,固定付一块任务方差 τ;SFT 硬学,付的是 2σ̃²/s,数据又噪又少时这笔账更亏。Corollary 3.4 确认,非退化情形下 ICL 弱优于直接用预训练模型。
拥塞进来之后,这个排序可以翻。均衡存在,且均衡拥塞水平 R 唯一(Theorem 4.1);策略本身不必唯一。比较静态经常不是单调的。
| 变量 | 对均衡拥塞 R 的影响 |
| 先验精度 π | 总是下降:更好的预训练替代在线个性化 |
| 覆盖维数 r | 算力便宜时呈升-降-升;算力贵时单调上升 |
| 任务噪声 σ̃ | 噪声小时随噪声升,大到劝退个性化后下降 |
| SFT 相对更贵 | ICL 够便宜时先升后降,否则单调降 |
| 资源单价 p | 单调下降(Theorem 5.2) |
利润最大化的价格在正则条件下有限(Proposition 5.3)。Theorem 5.5 证明:菜单里加上 SFT,均衡拥塞不会下降,最大利润也不会变差。SFT 更吃资源,有人觉得划算就会切过去,总需求只可能升。
实验用约 2200 万参数的 GPT-2(embedding 256、12 层、8 头),从零预训练,输入故意做成秩亏,覆盖维 r=15,环境维 d 取 15/17/19/21,任务是噪声方差 0.5 的线性回归。ICL 误差随样本数下降后平台,平台高度与未覆盖维数 d−r 近似线性,拟合 R²=0.96。SFT 在样本量很大(例如 500)时误差低于 ICL,样本接近 1 时更差;继续加样本可以把误差打向 0。这只验证了统计预测,没有把用户选择和排队跑成闭环。
文档普查覆盖 AI Index 2024/2025 里 21 家发过重要基础模型的公司。「提供 SFT」被定义成公司 API 上能微调,开源权重本身不算。同时提供 SFT 与 ICL 的比例从 2021 年 9.5% 升到 2022 年 14.3%、2023 年 42.9%、2024 年 66.7%、2025 年 71.4%。Apple、DeepSeek、Meta、Midjourney 在这份表里记为未提供 SFT API。
给做 serving 和产品的人一条能复述的规则:任务落在预训练知识里、示范又少又噪,ICL 更稳;示范足够、还要往模型里灌没见过的知识,才轮到 SFT。共享集群上,这条规则会被排队时间改写。扩覆盖、加难任务、提高 SFT 单价,都可能在某一段把总负载推高,而不是压低。
对平台,结论偏保守但清楚:把 SFT 加进菜单,至少不伤最大利润,负载却可能上去,所以要用价格把总需求按回去。这是对 2021 到 2025 年微调 API 快速铺开的一个机制解释,不是因果证明。
线性回归上的 GPT-2 实验说明,「ICL 改不了未覆盖方向」至少在 Garg 等人那类 in-context 线性回归测试床上对得上号。
作者点了两条延伸:现实是多平台竞争,模型里只有一个平台;推理模型用更高延迟换质量,算法集合需要再扩一档。
更大的缺口在验证。谱对齐、各向同性、二次拥塞函数都是为了闭式解;附录对指数和 hinge 形式做过数值核对,但没有真实流量。实验只跑了 22M GPT-2 的线性回归,没有语言任务,也没有把选择和排队反馈跑通。平台表格是文档回顾,开源权重被刻意排除,Meta、DeepSeek 记成未提供会压低统计,跟「加菜单不伤利润」之间只有方向一致。LoRA、adapter 这类中间成本方法没有进菜单。用户类型是统计原语 (d, r, σ̃, π, τ),不是账单或产品日志。