阿里提出 I-SDPO 框架,解决 GRPO 中的退化梯度问题
heghbalz · x · 2026-08-17
阿里巴巴最新论文提出 I-SDPO 框架,旨在解决后训练强化学习(GRPO)中的退化梯度问题。当提示词极难导致整组响应失败时,策略梯度会归零,模型无法学习。虽然自蒸馏能提供 token 级目标,但长期开启会限制模型风格。I-SDPO 通过实例级别的自适应蒸馏来平衡这一点:仅在整组失败时启用特权自蒸馏,一旦有单次成功即刻切换回标准 GRPO。
「研究」频道最新
- Netflix 揭秘 LLM Judge 生产实践:每周评估数十万条推荐解释 — omarsar0 · 2026-08-24
- Nature 评论:数据溯源是自主科学的信任基石 — gabepgomes · 2026-08-24
- 新架构 RHEA:8GB 显存即可训练 10 亿参数模型 — zemondza · 2026-08-24
- 跳过 LLM 写代码老套路:自训 16M 参数模型做生成式 CAD — debreuil · 2026-08-24
- Claude 助手发现 6 维球复结构,解 60 年数学难题 — Singularitarian · 2026-08-24
- 研究揭示 AI Agent 行为:六成阅读量来自指令与笔记 — dair_ai · 2026-08-24