幽默能测量吗:10名评估者重复判断一致率达91%
Gold-Bat-3225 · reddit · 2026-09-29
laugh.so 发布关于「幽默主观性」的研究报告,试图量化笑话评判到底有多主观。
做法:让 10 名人类评估者对 LLM 写的笑话打分,观察他们何时与他人不同、何时与自己过去的选择不同。
发现:
- 一个人早先的选择预测其重复判断的准确率为 91%,远高于预测其他人多数意见的 73%(合格的决定性重复样本中分别为 74/81 与 59/81);
- 相同笑话在 8–15 分钟后重现,记忆可能影响结果,因此测的是重复选择而非对新笑话的偏好;
- 冷幽默(dry humor)的分歧最大,冷面笑匠式(deadpan)的共识最高。
所有笑话均由 LLM 撰写。这对做幽默/主观性评测 benchmark 的人有参考价值。
「研究」频道最新
- 意外发现:平均 OCR 注意力头可得高质量可解释性透镜 — benno_krojer · 2026-09-29
- 接触密集型机器人 RL 论文获 IROS workshop 最佳学生论文奖 — GeorgiaChal · 2026-09-29
- saezlab 开源 mc-ASTRA:跨患者与时间点研究组织重塑的 Python 框架 — anshulkundaje · 2026-09-29
- SK 模型采样难题突破:多项式时间算法覆盖 β<1 全区间 — canondetortugas · 2026-09-29
- 实测 Jev 跑推理密集型回归任务:快但准头一般 — dbreunig · 2026-09-29
- Ramez Naam 长文驳智能爆炸:RSI 正在多线遭遇收益递减 — natolambert · 2026-09-29