无需外部监督,新方法实现大模型自我蒸馏纠错
UCSanDiego · hf · 2026-08-12
UC SanDiego 发布了一项新研究,提出了一种无监督的在线策略自我蒸馏方法。
该方法利用模型内部的一致性和多数投票产生的伪解决方案,在没有外部监督的情况下,能够纠正大语言模型中自信但错误的输出,从而提升模型整体能力。
「研究」频道最新
- 研究者呼吁:用强化学习改进大模型心智理论,解决表达晦涩问题 — lateinteraction · 2026-08-12
- Kimi K3 蒸馏争议:论文作者承认未证实,或为数据污染 — bookwormengr · 2026-08-12
- RefineAny3D:用微调VLM优化单目3D检测 — kwangmoo_yi · 2026-08-12
- 表格 ML 难题:分类变量何时应单独建模? — mariofilhoml · 2026-08-12
- 前沿大模型缺乏心智理论,开发者呼吁引入RL训练 — lateinteraction · 2026-08-12
- 伯克利等提出MLS-Bench:AI Agent能搞科研,但还提不出新方法 — 机器之心 · 2026-08-12