62人盲测48个LLM笑话 大模型幽默感持续进步

Paras Chopra 发布了一项检验前沿大模型幽默感的实验:62 名受访者对来自六个模型的 48 个笑话进行盲测评分。结果显示模型的幽默感确实在进步,与 GPT-3 时代只会复述网上老梗的表现形成对比。作者还在 Substack 公开了完整方法与结果,两年对比进一步表明大模型在「幽默」这类不可验证领域的能力持续提升。

2026-10-06 ~ 2026-10-06 · 2 条相关