Google 提出 AdviSD:小型顾问模型自蒸馏,超越 GRPO 最高 6.4 个百分点
google · hf · 2026-10-01
Google 的 AdviSD(Advisor Self-Distillation)让一个可训练的小型顾问模型用自然语言建议来引导冻结的大模型执行器,并用执行反馈持续改进建议质量。
- 关键发现:看似合理的修正若不改变执行结果,继续用它学习反而会限制顾问在其它情境下的表现;论文在共享参数设定下给出了证明
- 方法:结果导向的强化学习 + 从带反馈条件的顾问副本中选择性自蒸馏——顾问对同一执行器输出分别在有无其建议的情况下打分,用分差大小决定哪些决策纳入监督,无需执行器似然或额外 rollout
- 实验:用 Qwen3-8B 顾问引导 Gemini 与 Claude,BFCL-v3 上超过 advisor-GRPO 4.2-6.4 个百分点,EnvScaler 上高 3.9-5.1 分
- 训练出的顾问可泛化到域外任务,跨执行器版本和模型家族迁移
「研究」频道最新
- CMU 发布 cua-speedrun:同分下 computer-use agent 速度差距可达 4.4 倍 — arankomatsuzaki · 2026-10-01
- OpenAI 基金会资助癌症免疫研究,200 名患者数据将完全开源 — anshulkundaje · 2026-10-01
- 循环复用 Transformer 块:260M 小模型以 4.9 倍低算力胜过 6.5 倍大模型 — arankomatsuzaki · 2026-10-01
- 48 位学者联合发布原子机器学习生态战略路线图 — FrankNoeBerlin · 2026-10-01
- 形式化验证专家批 AI 圈认知落后 15 年:现代 FV 不靠 SMT 与翻译器 — tianyin_xu · 2026-10-01
- 亚马逊提出OPERA动态数据剪枝,微调稠密检索器训练时间减半 — _reachsumit · 2026-10-01