RLSD改进序列级奖励训练

burny_tech · x · 2026-07-11

RLSD(Self-Distilled RLVR)讨论了如何改进 RLVR / GRPO 这类序列级奖励训练:

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →