LLM 幽默感评测:Gemini 3.7 略胜 GPT-4o 最差
scaling01 · x · 2026-08-30
Laugh Labs 发布了针对 16 个前沿大模型的幽默感评测报告,对比了超过 10 万条人类评分。
核心发现:
- 冠军:Gemini 3.7 Flash 以 64% 的人类对齐度排名第一(尽管优势微弱)。
- 自研模型:Laugh Labs 自行微调的 Judge 模型表现最佳,达到 73.6% 的对齐度。
- GPT-4o:在笑话评选中表现最怪异且最不好笑。
- Fable 5:被认为是“最有趣”的模型。
- 推理与后训练:额外的推理步骤会让模型稍微好笑一点;针对 Tulu 3 和 Olmo 3 的研究发现,后训练虽然提升了单个笑话的质量,但缩窄了模型的幽默覆盖范围。
「模型」频道最新
- Claude Opus 5 评测:基准飙升但日活体验翻车 — gerardsans · 2026-08-30
- 「字母b的曲线对模型不可见」:分词盲区梗再翻红 — rickasaurus · 2026-08-30
- Qwen3.8-27B 开启 thinking 耗时增加 6 倍但质量显著提升 — DerTomsn · 2026-08-30
- 异构GPU实测Qwen3.8-27B:eGPU层分模式与MTP加速全解析 — CoffeeToCode99 · 2026-08-30
- MiniMax 联合发布新模型,引发布场争议 — altryne · 2026-08-30
- 双摆视频解释为何 LLM 极度敏感且不稳定 — emax · 2026-08-30