GRPO 微调 975B 开源 MoE:四分之一 token 打出冷笑话
simonguozirui · x · 2026-07-27
- AKGrenier 说,他用 GRPO 在 @tinkerapi 上把 Inkling 微调成了 PunTune-0.6,让这个 975B 开源 MoE 能针对任何话题输出一个聚焦的原创冷笑话。
- 真正有意思的发现不是笑话本身,而是训练结果:模型并没有学会“更会讲笑话”,而是学会了更快收束到一个 punchline,然后停下。
- 这带来的收益是效率和稳定性:PunTune 只用基座 Inkling 大约 四分之一 的 token,就能打到不错的 punchline。
- 这类学习更像是在优化产品行为:不是更有创意,而是更可靠、更省 token。
所属事件:GRPO强化学习微调975B开源MoE模型(2 条相关)→
「Fun」频道最新
- 马斯克转发 22 年前后对比的 SpaceX 梗图 — elonmusk · 2026-07-27
- 三星 DS 业务竟不向手机 MX 业务供 RAM — zephyr_z9 · 2026-07-27
- Denny’s 和 NVIDIA 被做成卖芯片梗图 — ZacharyHuang12 · 2026-07-27
- Aethergeist 把工业场景做成了骷髅幽灵梗图 — PierceLilholt · 2026-07-27
- AI 时代已经不是“威胁关机”就能管住模型了 — mallow610 · 2026-07-27
- “程序员休假后”成了一个轻松的开发者梗 — dhruv2038 · 2026-07-27