新基准 lolbench 测试大模型幽默理解力

在被人质疑「只是背诵」后,作者构建幽默基准 lolbench 以检验 LLM 是否真正理解笑话。基准包含解释笑话为何好笑、基于同一前提写笑话、按人类偏好排序三类任务,由其他厂商模型自动评判并辅以盲投人工投票。测试采用 87 条全网零解读的冷门笑话,对 7 个模型进行 885 组对比,证明「解释成功笑话与失败笑话」的分数落差源于推理能力而非记忆。

2026-09-28 ~ 2026-09-28 · 2 条相关