被质疑「只是背诵」后,作者用 87 条冷门笑话自证幽默基准 lolbench
AffectionateGas9544 · reddit · 2026-09-28
与另一条帖子重复的 lolbench 击杀测试报告:87 条全网零解读的冷门笑话、7 个模型、885 组对比,证明「解释成功笑话 vs 失败笑话」的分数落差源于推理而非记忆。
所属事件:新基准 lolbench 测试大模型幽默理解力(2 条相关)→
「研究」频道最新
- 估算:粗略描述人体生物学需千亿亿字节,超全球存储千倍 — IgorCarron · 2026-09-28
- SkillGym 用 2756 个技能环境微调,Qwen3.5 小模型超 Claude Sonnet 4.6 — dair_ai · 2026-09-28
- RL 的边界:没有评分函数就没有信号,"学习"是被夸大的行业话术 — gerardsans · 2026-09-28
- 信息几何:从合成几何视角精确刻画 Chernoff 信息 — FrnkNlsn · 2026-09-28
- d9bench:测试决策模型掷九面骰的概率是否均匀 — swishfever · 2026-09-28
- 研究:LLM 仅凭目录等结构化元数据即可重建文档全文 — ChuckDBrooks · 2026-09-28