开发者自建 lolbench:LLM 讲笑话行,识破烂笑话难

AffectionateGas9544 · reddit · 2026-09-11

Reddit 开发者发布自建幽默基准 lolbench,让 LLM 参加三项测试:解释笑话为何好笑(或不好笑)、在给定前提下创作笑话、盲测预测人类偏好。初步发现:各家模型解释真实笑话的正确率高达 95% 以上,但在解释「为什么一个失败的笑话不好笑」时明显下滑(81–92%)。项目还设有人类投票环节:用户盲选两个 AI 笑话中更好笑的一个,再揭示出自哪些模型及与其他数千投票者的一致度,单次约 30 秒。作者开放评测系统答疑并征集反馈。

所属事件:开发者推 lolbench 基准测试 LLM 幽默理解(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →