Latent On-Policy Self-Distillation 提升智能体性能
NationalUniversityofSingapore · hf · 2026-08-17
新加坡国立大学发布了 Latent On-Policy Self-Distillation 方法。该方法从经验中端到端学习特权教学上下文,提供密集的 token 级监督,从而提升智能体的性能与效率。
「研究」频道最新
- AI 筛选书单:压缩烹饪模型与意识速度研究 — emollick · 2026-08-17
- 研究:黑盒交互可窃取Agent技能,平均恢复率达48% — rohanpaul_ai · 2026-08-17
- 集成色散管理飞秒激光器实现低阈值光频梳 — jwt0625 · 2026-08-17
- AI Agent记忆系统研究:默认召回策略常失效,排名比门控更重要 — Stefania_druga · 2026-08-17
- MirrorCode 揭示:AI 已能完成耗时数周的编程任务 — 141_1337 · 2026-08-17
- HelixWorld 1.0:首个可交互音视频世界模型发布 — 量子位 · 2026-08-17