DiffusionOPSD:扩散模型中的策略自蒸馏
ByteDance-Seed · hf · 2026-08-26
字节跳动提出 DiffusionOPSD,利用策略自蒸馏将图像级奖励转化为扩散模型的显式中间目标。该方法提高了对齐效率,并允许对目标构建和策略拟合进行单独分析。
「研究」频道最新
- 通过版本对比追踪并发现 scikit-learn 的 Bug — Lost-Dragonfruit-663 · 2026-08-26
- Gemini Flash 3.7 联手 GraphJin,实测通过企业级 Agent 安全基准 — dosco · 2026-08-26
- 机器人研究员反思:先问推理行为,再谈模型训练 — deepakpathak · 2026-08-26
- AI 训练应诚实告知模型环境是假的 — Sauers_ · 2026-08-26
- 研究发现LLM推理易受“先验劫持”误导 — RexDouglass · 2026-08-26
- 上交大 SemaPLC:验证闭环让 AI 写 PLC 代码动态行为得分翻 1.7 倍 — 量子位 · 2026-08-26