低资源语言微调:SFT 转移语言,RL 修复格式

KIEFERSA · hf · 2026-08-21

论文探讨了在低资源语言上微调混合专家模型的发现:SFT 会在不影响准确率的情况下将推理过程迁移到该语言,而基于可验证奖励的强化学习则能有效修复格式和泄露问题。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →