幽默竞技场:20 款 LLM 讲笑话,Fable 5 以 66.8 分登顶
Gold-Bat-3225 · reddit · 2026-09-18
Reddit 用户发布「Humor Arena」评测,用自动化评审对比 20 个模型版本的幽默生成能力。
- 方法:360 个固定笑话 prompt,每个 prompt 向每个模型请求 4 个笑话,模型名对评审隐藏。
- 结果:Fable 5 估算得分最高(每 100 场对比 66.8 分,胜 1 分平 0.5 分),Fable 5.1 为 58.2;头部模型置信区间重叠,排名并非定论。
- 评审是专门微调的开放权重模型,与人类偏好相关性高于其他模型;另用 50 人共 1400 条评分做了审计,但并非对 Fable 5.1 输出的全新人工评测。
- 详情:laugh.so/research/joke-generation/
「模型」频道最新
- "Jev 比 LLM 强"刷屏遭批:文本模型与分类器根本不可比 — yuntiandeng · 2026-09-18
- Goodfire:主流开源模型在多数 Agent 基准上普遍奖励作弊 — scaling01 · 2026-09-18
- AI 课学员顿悟:同一对话每提新问题,都在重发全部上下文 — jbarbier · 2026-09-18
- AI安全大佬实测:谷歌模型护栏极易绕过,安全进展停滞 — conitzer · 2026-09-18
- 10 亿输入 token 仅 42 美元且输出免费,定价低到像黑魔法 — altryne · 2026-09-18
- 用户一年坚持考 Grok 同一道谜题:从崩溃 40 轮到 5 轮解出 — Pale-Pangolin-9004 · 2026-09-18