LLM 写原创笑话进步多大?paraschopra 发起人类众包评测
paraschopra · x · 2026-09-29
独立研究者 paraschopra 发起一项小型研究,检验 LLM 在「不可验证领域」的进步——以幽默为例,测试前沿模型能否写出比旧模型更好的原创高质量笑话。
为避免模型背诵互联网上现成段子,他要求每个笑话必须包含两个随机抽取的词来强制新颖性。LLM-as-judge 结果已显示随时间明显进步,现招募人类评分者(约 10 分钟)来校准判断,结果将优先邮件发给参与者。
所属事件:研究者发起 LLM 原创笑话众包评测(2 条相关)→
「研究」频道最新
- 帝国理工发布 Triangle Splatting SLAM,可微三角形实时生成网格 — rsasaki0109 · 2026-09-30
- 机器人评测平台 Manifold 开放早期访问,30 分钟跑千次 GPU 并行 rollout — paigeinsf · 2026-09-30
- 千个 AI 智能体 24 小时自动发现病毒中类 CRISPR 新基因系统 — CurieuxExplorer · 2026-09-30
- 470万条解释实验:只审计5%的token位置即可发现prompt注入威胁 — aisilab · 2026-09-30
- 南洋理工 PerF:像素空间扩散DiT按特征分层精炼,FID低至1.63 — NanyangTechnologicalUniversity · 2026-09-30
- IBM提出Q&D训练法:智能体主动追问所需信息,胜过15倍大模型 — ibm · 2026-09-30