975B 开权重 Inkling 经 RL 微调后笑话更短更稳
shizhediao · x · 2026-07-27
- 作者分享了一个 RL 微调实验:用 GRPO 在 tinkerapi 上把开权重 975B MoE 模型 Inkling 训成了 PunTune-0.6,让它能针对任何话题输出一个聚焦、原创的冷笑话。
- 他的核心发现不是“模型变得更会讲笑话了”,而是训练让模型学会了选定一个包袱,然后停住;提升的是稳定性和表达经济性,不一定是创造力。
- 图示和文字都强调:PunTune 只用基础模型大约 四分之一的 token 就能打出像样的 punchline。作者认为这类结果有助于产品团队理解训练究竟能改善什么、又有哪些能力边界。
所属事件:GRPO强化学习微调975B开源MoE模型(2 条相关)→
「Fun」频道最新
- 网友称 Claude Opus 5.5 视觉设计能力为测试过的模型中最佳 — _sholtodouglas · 2026-09-23
- 用户实测:opus-5.5 管你睡觉的唠叨比 fable-5.1 少多了 — adonis_singh · 2026-09-23
- 观察者称深度沉迷 LLM 者多有明显自恋倾向,远超基线 — repligate · 2026-09-23
- 宇树 H2 人形机器人摔倒如不倒翁,顽强爬起萌翻网友 — CyberRobooo · 2026-09-23
- 梗图调侃:科技老哥们都说「Claude Code 改变了我的人生」 — Signalman23 · 2026-09-23
- AI 艺术只是「精致复刻」?圈内热议为何没诞生新美学 — PAstynome · 2026-09-23