被质疑「只是背诵」后,作者用 87 条冷门笑话自证幽默基准 lolbench

AffectionateGas9544 · reddit · 2026-09-28

与另一条帖子重复的 lolbench 击杀测试报告:87 条全网零解读的冷门笑话、7 个模型、885 组对比,证明「解释成功笑话 vs 失败笑话」的分数落差源于推理而非记忆。

所属事件:新基准 lolbench 测试大模型幽默理解力(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →