开发者自建 lolbench:LLM 讲笑话行,识破烂笑话难
AffectionateGas9544 · reddit · 2026-09-11
Reddit 开发者发布自建幽默基准 lolbench,让 LLM 参加三项测试:解释笑话为何好笑(或不好笑)、在给定前提下创作笑话、盲测预测人类偏好。初步发现:各家模型解释真实笑话的正确率高达 95% 以上,但在解释「为什么一个失败的笑话不好笑」时明显下滑(81–92%)。项目还设有人类投票环节:用户盲选两个 AI 笑话中更好笑的一个,再揭示出自哪些模型及与其他数千投票者的一致度,单次约 30 秒。作者开放评测系统答疑并征集反馈。
所属事件:开发者推 lolbench 基准测试 LLM 幽默理解(2 条相关)→
「研究」频道最新
- Simplex 新研究:LLM 激活中的信念几何呈「套叠锥形」结构 — fatihdin4en · 2026-09-11
- DeepSeek CED 与 GLM 的 KV 缓存复用到底差在哪?一条推文讲清架构细节 — stochasticchasm · 2026-09-11
- SG-JEPA 论文:世界模型「地球训练、火星部署」,零样本物理泛化误差减半 — randall_balestr · 2026-09-11
- Levin 发布 Platonic Space 论文同行评审版:争议最大的一篇 — AnnaCiaunica · 2026-09-11
- Code-as-Policy 文章热议:通用模型开始像操作软件一样操作机器人 — yawnxyz · 2026-09-11
- 错过首尔现场?ICML 生成式 AI 与创造力研讨会发布新综述 — lasha_nlp · 2026-09-11