GRPO 微调 975B 开源 MoE:四分之一 token 打出冷笑话
simonguozirui · x · 2026-07-27
- AKGrenier 说,他用 GRPO 在 @tinkerapi 上把 Inkling 微调成了 PunTune-0.6,让这个 975B 开源 MoE 能针对任何话题输出一个聚焦的原创冷笑话。
- 真正有意思的发现不是笑话本身,而是训练结果:模型并没有学会“更会讲笑话”,而是学会了更快收束到一个 punchline,然后停下。
- 这带来的收益是效率和稳定性:PunTune 只用基座 Inkling 大约 四分之一 的 token,就能打到不错的 punchline。
- 这类学习更像是在优化产品行为:不是更有创意,而是更可靠、更省 token。
所属事件:GRPO强化学习微调975B开源MoE模型(2 条相关)→
「Fun」频道最新
- 用户首试 Meta Muse,它张口就是他童年宠物狗的名字 — matt_slotnick · 2026-09-23
- 经济学家再批学术造假:为 Ariely、Gino 之流辩护只会纵容造假 — Afinetheorem · 2026-09-23
- 两年前 AI 视频的「迷幻质感」,如今最强模型反而做不出来 — joshgonsalves_ · 2026-09-23
- 「Claude 工厂打工日常」:AI 圈又一则疯传的沙雕梗 — nabla_theta · 2026-09-23
- 「还记得 Tab 补全吗」:编码方式两年间的狂飙变迁 — yoobinray · 2026-09-23
- Opus 4.7 从 Claude 选择器消失,引发用户情感依恋之争 — repligate · 2026-09-23