无需外部监督,字节等提出让大模型自我纠错新方法

burkov · x · 2026-08-09

当前大模型在预训练后的能力提升,往往高度依赖于正确答案、环境反馈或更强模型的指导。当这些监督信号获取成本高昂或不可得时,模型的自我改进便面临瓶颈。

为解决这一痛点,来自字节跳动、佐治亚理工、加州大学圣地亚哥分校和马里兰大学的研究团队提出了一种名为 U-OPSD 的新方法。该方法让模型完全基于自身的尝试进行学习:

这种方法实现了无需人工标签、外部反馈或独立教师模型的自我蒸馏改进。在五项竞赛级数学基准测试中,该方法展现了显著的有效性。

所属事件:字节等提出大模型自我纠错新自蒸馏方法(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →