被质疑「只是背诵」后,作者用 87 条冷门笑话自证幽默基准 lolbench
AffectionateGas9544 · reddit · 2026-09-28
作者构建的 lolbench 旨在测试 LLM 是否真正理解幽默,包含解释笑话为何好笑、基于同一前提写笑话、按人类偏好排序三类任务,由其他厂商模型自动评判并配盲投人工投票。
- 原始发现:所有模型解释「真实笑话为何好笑」正确率 95%+,但解释「失败笑话为何失败」仅 81-92%,存在明显落差
- 质疑:有评论者指出,著名笑话网上到处是解读,解释成功笑话可能只是回忆;失败笑话无现成解读,才是纯生成——该落差或许测的是「记忆 vs 思考」的距离
- 击杀测试:作者挑了 87 条全网确证零解读的冷门笑话,7 个模型、2 个评判、885 组对比,成本 $0
- 结果:分数并未坍缩——冷门好笑话与著名好笑话得分一致(均值差 +0.1,全部模型落在置信区间内),且「成功 vs 失败」的落差在两条同样冷门的条目之间依然成立
结论:该落差反映的确实是理解/推理差异而非熟悉度,原基准设计经受住了证伪尝试。分模型数据见 lolbench.lol/kill-test。
所属事件:新基准 lolbench 测试大模型幽默理解力(2 条相关)→
「研究」频道最新
- 斯坦福研究:GPT-4 单独诊断胜过「有 GPT-4 协助」的医生 — jonc101x · 2026-09-28
- Meta 发布 TRIBE v2:三模态基础模型精准预测人脑活动 — burny_tech · 2026-09-28
- Laya 用 322M 小模型替代 LLM-as-a-judge,9 天斩获 2.6 万星 — AIFrontierReads · 2026-09-28
- 「重构身份」概念提出:LLM 跨模态拼接弱信号可去匿名化 — AmuzedX · 2026-09-28
- 谱收缩新框架改进 Muon 训练,GPT-2 预训练验证损失一致下降 — hankyang94 · 2026-09-28
- CMU 发布 DeformX:UR5e 绳索甩打精准击落头顶苹果 — DJiafei · 2026-09-28