研究者发起 LLM 原创笑话众包评测

独立研究者 paraschopra 发起一项众包评测,检验前沿大模型在「不可验证领域」——幽默创作上的进步,测试其能否写出比旧模型更好的原创高质量笑话。为避免模型背诵互联网上已有的段子,测试要求模型生成强制包含两个随机词的原创笑话。他已放出评分入口,邀请公众花约 10 分钟为模型段子打分,参与者将优先收到研究结果邮件。

2026-09-29 ~ 2026-09-29 · 2 条相关