Google 提出 AdviSD:小型顾问模型自蒸馏,超越 GRPO 最高 6.4 个百分点

google · hf · 2026-10-01

Google 的 AdviSD(Advisor Self-Distillation)让一个可训练的小型顾问模型用自然语言建议来引导冻结的大模型执行器,并用执行反馈持续改进建议质量。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →