开发者推 lolbench 基准测试 LLM 幽默理解

Reddit 开发者发布自建幽默基准 lolbench,让 LLM 参加三项测试:解释笑话为何好笑或不好笑、在给定前提下创作笑话、盲测预测人类偏好。初步结果显示,各模型解释真实笑话的准确率可达 95% 以上,但解释烂笑话时掉到约 81%,说明 LLM 讲笑话尚可、识破烂笑话仍有难度。

2026-09-11 ~ 2026-09-11 · 2 条相关