无需外部监督,字节等提出让大模型自我纠错新方法
burkov · x · 2026-08-09
当前大模型在预训练后的能力提升,往往高度依赖于正确答案、环境反馈或更强模型的指导。当这些监督信号获取成本高昂或不可得时,模型的自我改进便面临瓶颈。
为解决这一痛点,来自字节跳动、佐治亚理工、加州大学圣地亚哥分校和马里兰大学的研究团队提出了一种名为 U-OPSD 的新方法。该方法让模型完全基于自身的尝试进行学习:
- 生成与投票:针对每个问题生成多个解决方案,并将多数同意的答案作为临时训练目标。
- 自我蒸馏:将达成共识的解决方案作为额外上下文,指导同一个模型的「教师」版本,进而纠正那些偏离多数共识的错误方案。
这种方法实现了无需人工标签、外部反馈或独立教师模型的自我蒸馏改进。在五项竞赛级数学基准测试中,该方法展现了显著的有效性。
所属事件:字节等提出大模型自我纠错新自蒸馏方法(2 条相关)→
「研究」频道最新
- TensorSharp 直读 label logits,结构化决策比 LocalJev 快 3.3 倍 — fuzhongkai · 2026-09-23
- Naproche:用受控自然语言写数学证明的证明助手 — zetalyrae · 2026-09-23
- 南京大学用 AI 从零设计超强蛋白,强度超天然 4 倍耐 150°C — MikePFrank · 2026-09-23
- 开源 GUI 智能体跨设备实测:复合任务最佳成功率仅 8% — maier_ak · 2026-09-23
- JarvisGUI 基准:跨 Android/Windows/Ubuntu 考验 GUI 智能体 — maier_ak · 2026-09-23
- 新基准 Cross-DURIAN:专测多设备 GUI 智能体跨屏协作能力 — maier_ak · 2026-09-23