975B 开权重 Inkling 经 RL 微调后笑话更短更稳
shizhediao · x · 2026-07-27
- 作者分享了一个 RL 微调实验:用 GRPO 在 tinkerapi 上把开权重 975B MoE 模型 Inkling 训成了 PunTune-0.6,让它能针对任何话题输出一个聚焦、原创的冷笑话。
- 他的核心发现不是“模型变得更会讲笑话了”,而是训练让模型学会了选定一个包袱,然后停住;提升的是稳定性和表达经济性,不一定是创造力。
- 图示和文字都强调:PunTune 只用基础模型大约 四分之一的 token 就能打出像样的 punchline。作者认为这类结果有助于产品团队理解训练究竟能改善什么、又有哪些能力边界。
「Fun」频道最新
- 创作者用两个 AI 做出一首合作新歌 — Mpire2025 · 2026-07-27
- 谷歌 AI Overview 让一个小球唱歌发光再滚走 — Sauers_ · 2026-07-27
- 数学学生据称周末用 LLM 证明了 6 万个定理 — burkov · 2026-07-27
- 统计学梗图把 REML 平滑器写成“追捕过拟合” — Sauers_ · 2026-07-27
- 帖子把 Opus 3 写成神话级 AI 舞台演员 — repligate · 2026-07-27
- 用 Opus 5 和 Grok 4.5 一把通关刺客信条的玩笑 — Kyrannio · 2026-07-27