AI 模型谁最幽默?Humor Arena 基准:Claude 暂列第一
julianweisser · x · 2026-08-05
Laugh Labs 推出了 Humor Arena 基准,专门测试各大前沿 AI 模型讲笑话的幽默感。
- 评测规模:14 个前沿模型针对相同的 360 个提示词各写了 4 个笑话,收集了 6480 次评判和 1400 次人类评分。
- 排名情况:Claude Fable 5 暂列第一,但前四名的差距极其微小。
- 模型演进:与退役版本相比,新一代模型在讲笑话方面确实在逐渐变得更有趣。
- 思考时间:让模型在回答前“思考”更长时间对提升幽默感仅有边际帮助。
- 地狱笑话:面对黑暗题材的提示词,没有任何模型拒绝,但它们在“地狱笑话”上的表现并未出现统计学上的显著变化。
「Fun」频道最新
- AI 圈梗图:欧盟忙监管,中国直接开源 AGI 压缩包 — PanParagraf · 2026-08-05
- 「我在用你听都没听过的中国模型」 — DesireeCachette · 2026-08-05
- Fable 多模态模型生成奇幻短片:夜晚的桌子 — repligate · 2026-08-05
- Fable 模型生成意识流图文:凝结 — repligate · 2026-08-05
- 曝OpenAI新模型gpt-5.6-luna因性价比过高致服务器过载 — _lewtun · 2026-08-05
- DeepSeek标语与梁文锋的「无人区」探险奇遇 — teortaxesTex · 2026-08-05