LLM 写原创笑话进步多大?paraschopra 发起人类众包评测

paraschopra · x · 2026-09-29

独立研究者 paraschopra 发起一项小型研究,检验 LLM 在「不可验证领域」的进步——以幽默为例,测试前沿模型能否写出比旧模型更好的原创高质量笑话。

为避免模型背诵互联网上现成段子,他要求每个笑话必须包含两个随机抽取的词来强制新颖性。LLM-as-judge 结果已显示随时间明显进步,现招募人类评分者(约 10 分钟)来校准判断,结果将优先邮件发给参与者。

所属事件:研究者发起 LLM 原创笑话众包评测(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →