LLM 笑话实验全纪录:两年对比显示幽默感持续进步
paraschopra · x · 2026-10-06
Paras Chopra 在 Substack 发布完整方法与结果:检验前沿模型在「幽默」这一不可验证领域能力是否在进步。
- 实验动机:GPT-3 时代模型只会复述网上老梗(如「原子不可信,因为它们编造一切」),作者要求生成原创笑话
- 62 名受访者盲评六个模型的 48 个笑话,Astra 以 50%+ 的「会心一笑/大笑」率夺冠
- 读者票选出的最搞笑笑话:「看到彩虹的概率在雨后会上升。不幸的是,我把衣服晾在外面的概率也一样。」
- 核心问题:数学/代码等可验证域的能力进步,能否迁移到依赖「品味」的软性能力
与前推为同一实验,本条含方法学细节与获胜笑话。
所属事件:62人盲测48个LLM笑话 大模型幽默感持续进步(2 条相关)→
「Fun」频道最新
- 「人类只是大模型的开机引导程序」段子引热议 — ryunuck · 2026-10-06
- 飞机上看到「正宗」系列电影,AI 假货内容已渗透流媒体 — moyix · 2026-10-06
- 让 Claude Opus 5.5 自主炫技:连续干活 1 小时 37 分交出动画视频 — mcraddock · 2026-10-06
- 末日论者砸重金制作 AI 末日内容,YouTube一夜涌现大量高质视频 — basedjensen · 2026-10-06
- 30 分钟用提示词做出一款「痛殴你的烦恼」小游戏 — Tegadesigns · 2026-10-06
- Claude Opus 5.5 自己列出将被它取代的 20 种工作 — minchoi · 2026-10-06