三星联合牛津北大推出 TrOPD,让端侧小模型继承大模型推理
jiqizhixin · x · 2026-09-26
三星、牛津大学与北京大学联合提出 TrOPD
背景:前沿模型(如 GPT-6)持续扩大规模,但推理成本上升正成为普及瓶颈。三星拥有数亿台边缘设备,矛盾尤其直接:端侧模型必须“足够聪明”,又要受限于内存、算力、功耗与延迟。
方法:论文提出 Trust Region On-Policy Distillation(TrOPD)。
- On-Policy Distillation(OPD)不同于 GRPO 依赖结果奖励驱动探索,而是用教师大模型提供细粒度监督,让端侧小模型直接学习更强模型的推理过程。
- TrOPD 进一步识别教师监督中“可信”的区域,使小模型更稳定、有效地继承大模型能力,避免不可靠监督带来的退化。
「Infra」频道最新
- Vpipe 对比 Draw Things:Mac 本地生图快 22-24%,2K 下更稳定 — TgoAI · 2026-09-26
- AMD 发布 Helios GPU 教学版 GEMM 优化阶梯:从基线到峰值性能 — salykova_ · 2026-09-26
- Terafab 启动招聘:目标年产 1TW 芯片,剑指轨道 AI 算力 — seanmcdonaldxyz · 2026-09-26
- 从单节点到百万节点:作者分享 LLM 推理扩容实践博客 — abhijithneil · 2026-09-26
- LLM API 该按量付费还是承诺用量?真实采购决策的三个问题 — LeviYagami · 2026-09-26
- 德国荷兰投4000万欧元,挑战用AI设计AI芯片 — VraserX · 2026-09-26