字节等提出大模型自我纠错新自蒸馏方法

当前大语言模型在预训练后的能力提升高度依赖标准答案、环境反馈或更强教师模型的指导。为打破这一瓶颈,字节跳动等机构的研究人员提出了一种全新的自蒸馏方法。该方法无需任何外部监督信号,即可有效激发大模型的自我纠错与改进能力,大幅降低了模型自我提升对昂贵监督成本的依赖。

2026-08-08 ~ 2026-08-09 · 2 条相关