花一周做的日历 benchmark 拿到个人最高评审分:8/7/7 的低投入论文故事
cneuralnetwork · x · 2026-09-20
作者分享了自己评分最高的论文(个人审稿评分 8/7/7)竟是最省力的一篇的经过:
- 起点:在 WAT 会议上看到一位日本研究者展示 LLM 在日语日历任务上表现糟糕,作者把 Raj(prajdabre)从茶歇拽来,问「为什么我们不把所有可能的日历任务都做了?」
- 执行:两天内做出覆盖 5 种文化日历系统、7-8 类任务的完整 benchmark,结果显示当时 LLM 表现惨不忍睹
- 恰逢 ICLR 有一个专门讨论 LLM 短板任务的工作坊,于是趁热打铁,一周写完论文投出,拿到高评分
一个关于「好问题 + 快速执行」比苦工更重要的科研轶事。
「Fun」频道最新
- JEV 解验证码毛利达 99.32%,发帖者威胁不开源就 继续 — gaganghotra_ · 2026-09-21
- AI 圈热梗「Clanker」仍被词典判为无效词,作者预测快了 — aronchick · 2026-09-21
- 用 AI 检测器 Pangram 拆穿「辛苦长文」:100% AI 生成 — retr0jirachi · 2026-09-20
- AI 助手识破经销商隐藏费用,帮用户省下超 1250 美元 — armand_ruiz · 2026-09-20
- AI 给我画的肖像「比漫画还冒犯」,全家 Facetime 笑疯 — floguo · 2026-09-20
- AI 生成未来城市图引争议:反乌托邦还是值得向往? — AIandDesign · 2026-09-20