深挖 OpenAI 经典论文:弱模型如何有效监督强模型

ziv_ravid · x · 2026-08-01

作者借 Aschenbrenner 新基金引发的热议,重温了他在 2023 年参与合著的《弱到强泛化》(Weak-to-Strong Generalization)论文。该论文由 OpenAI 超级对齐团队核心成员操刀,试图解决一个前沿难题:当模型能力超越人类时,人类如何提供可靠的监督信号?

论文设计了一个巧妙的实验框架:用 GPT-2 级别的小模型(模拟人类监督者)在真实标签上微调,随后将其带有噪声的预测作为监督信号去微调 GPT-4 级别的大模型,并彻底丢弃真实标签。

实验结果令人振奋:大模型并未盲目照搬小模型的错误。在常规微调下,大模型能恢复约 20% 的性能差距;若引入辅助置信度损失项(鼓励模型在分歧时保持自信),NLP 任务的性能恢复率可飙升至约 80%。这表明预训练已让大模型掌握了相关概念,弱监督的作用是“激发”而非“教导”。

作者进一步梳理了后续理论进展,指出学界已通过鲁棒性、凸回归和良性过拟合等多种数学工具,严密论证了这种弱到强泛化现象的内在机制。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →