开发者推 lolbench 基准测试 LLM 幽默理解
Reddit 开发者发布自建幽默基准 lolbench,让 LLM 参加三项测试:解释笑话为何好笑或不好笑、在给定前提下创作笑话、盲测预测人类偏好。初步结果显示,各模型解释真实笑话的准确率可达 95% 以上,但解释烂笑话时掉到约 81%,说明 LLM 讲笑话尚可、识破烂笑话仍有难度。
2026-09-11 ~ 2026-09-11 · 2 条相关
- LLM 讲笑话基准 lolbench:解释好笑话 95%+,解释烂笑话掉到 81% — AffectionateGas9544 · 2026-09-11
- 开发者自建 lolbench:LLM 讲笑话行,识破烂笑话难 — AffectionateGas9544 · 2026-09-11