LLM 讲笑话基准 lolbench:解释好笑话 95%+,解释烂笑话掉到 81%

AffectionateGas9544 · reddit · 2026-09-11

Reddit 用户 AffectionateGas9544 发布了自己搭建的 lolbench,测试 LLM 能否理解与创作笑话,包含三项测试:解释笑话为何好笑(或不好笑)、在相同前提下写笑话、盲测预测人类更偏好哪个笑话。

目前最意外的发现:各家模型解释真实笑话的成功率都在 95% 以上,但在解释「一个失败的笑话为什么失败」时明显掉分,只有 81–92%。

作者还上线了人类投票环节 lolbench.lol:两 model 生成的笑话盲选,投票后揭晓出自哪家模型、以及与其他数千投票者的一致程度,每轮约 30 秒。作者欢迎对评测系统的反馈。

所属事件:开发者推 lolbench 基准测试 LLM 幽默理解(2 条相关)→

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →