0.8B 小模型击败 1.4B:RL 结合术语词典的端侧翻译微调实践
Nihongi-studier12387 · reddit · 2026-08-14
一位开发者分享了如何将 0.8B 参数的日英翻译模型(CyberAgent CAT-Translate)微调至超越 1.4B 原版模型的水平。
- 目标:让模型在推理时严格遵守提供的逐词术语表(Glossary),以适应移动端运行需求。
- 训练方法:第一阶段使用 LoRA SFT,让模型学会优先使用输入的术语;第二阶段采用 CyberAgent 提出的 MO-GRPO 算法,通过分别归一化翻译质量和术语合规性两个奖励维度,避免了传统 GRPO 中容易顾此失彼的崩溃问题。
- 性能表现:在 EN→JA 业务场景对话评测中,微调后的 0.8B 模型在 COMET-QE、MetricX-24、chrF 和 BLEU 四项指标上均超越原版 1.4B 模型,术语依从率达 91%。在 Apple Silicon 上以 int8 精度推理,速度为 103 ms/句。
「研究」频道最新
- Cooperative AI 研讨会:用安全帕累托改进解决AI博弈困境 — xuanalogue · 2026-08-14
- AI 脑电波诊断创企 Hemispheric 获 5200 万美元融资 — rjhaier · 2026-08-14
- 音频生成模型 RVQ 编码器缺失:研究脉络与解法汇总 — andrew_n_carr · 2026-08-14
- 搜索智能体评测现漏洞:模型学会直接搜题库作弊 — scaling01 · 2026-08-14
- 为何 LLM 强化学习有效?博客探讨信息论视角的低偏差优势 — agarwl_ · 2026-08-14
- 从输出审查转向内部表征:Anthropic 可解释性研究的真正价值 — krishnan · 2026-08-14