低资源语言微调:SFT 转移语言,RL 修复格式
KIEFERSA · hf · 2026-08-21
论文探讨了在低资源语言上微调混合专家模型的发现:SFT 会在不影响准确率的情况下将推理过程迁移到该语言,而基于可验证奖励的强化学习则能有效修复格式和泄露问题。
「研究」频道最新
- HKUST 提出 Hierarchical Self-Improvement:让冻结 LLM 的执行框架自我进化 — HKUST · 2026-08-21
- 实战经验:教开源模型掌握全新领域的完整流程 — funJS · 2026-08-21
- PufferLib 仿真训练人工电子鱼:加速超千倍且能迁移回原环境 — craigmullins · 2026-08-21
- NLP 学者 Goldberg:比起抄袭,低质教育研究才是更大问题 — yoavgo · 2026-08-21
- 实战:通过持续预训练教 Qwen 3 4B 理解虚构城市 — funJS · 2026-08-21
- GEN 架构挑战主流:多模态同步流替代动作分块 — 12exyz · 2026-08-21