GRPO强化学习微调975B开源MoE模型

开发者利用 GRPO 强化学习方法,在 tinkerapi 平台上成功对名为 Inkling 的 975B 开源 MoE 模型进行了微调,推出了 PunTune-0.6。实验结果表明,该模型仅需四分之一的数据 token 即可生成冷笑话。经过 RL 微调后,模型在生成笑话的稳定性与简洁度上均获得了显著提升。

2026-07-27 ~ 2026-07-27 · 2 条相关