GRPO强化学习微调975B开源MoE模型
开发者利用 GRPO 强化学习方法,在 tinkerapi 平台上成功对名为 Inkling 的 975B 开源 MoE 模型进行了微调,推出了 PunTune-0.6。实验结果表明,该模型仅需四分之一的数据 token 即可生成冷笑话。经过 RL 微调后,模型在生成笑话的稳定性与简洁度上均获得了显著提升。
2026-07-27 ~ 2026-07-27 · 2 条相关
- 975B 开权重 Inkling 经 RL 微调后笑话更短更稳 — shizhediao · 2026-07-27
- GRPO 微调 975B 开源 MoE:四分之一 token 打出冷笑话 — simonguozirui · 2026-07-27