被质疑「只是背诵」后,作者用 87 条冷门笑话自证幽默基准 lolbench

AffectionateGas9544 · reddit · 2026-09-28

作者构建的 lolbench 旨在测试 LLM 是否真正理解幽默,包含解释笑话为何好笑、基于同一前提写笑话、按人类偏好排序三类任务,由其他厂商模型自动评判并配盲投人工投票。

结论:该落差反映的确实是理解/推理差异而非熟悉度,原基准设计经受住了证伪尝试。分模型数据见 lolbench.lol/kill-test。

所属事件:新基准 lolbench 测试大模型幽默理解力(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →