64 人评 2330 组对决:后训练让 LLM 更好笑,但笑话多样性明显下降

Gold-Bat-3225 · reddit · 2026-09-30

研究团队对「后训练是否让 LLM 更好笑」做了系统实验,选用全程公开训练阶段的开放模型,追踪从 base 到 instruct 的 11 个训练阶段(Tulu 3 基于 Llama 3.1 70B、OLMo 3.1 32B、Qwen2.5),用 100 条笑话 prompt、64 名人类评审、2330 组两两对决得出结论:后训练确实让模型更好笑,但付出了多样性代价。

主要发现:

方法:人类评审只对比 base 与最终模型,再用校准过的模型评委比较中间阶段。完整报告与论文见 laugh.so/research/humor-tax。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →