哪些 benchmark 还没被刷爆?RLI 最高分仅 20%
MaximumIntention · reddit · 2026-09-28
Reddit 讨论:随着模型能力快速提升,多数 benchmark 很快饱和。目前仍在维护且前沿模型得分极低(≤30%)的 benchmark 已寥寥无几:
- RLI:最高分仅 20%
- ProgramBench:最高分仅 4.5%
- FormulaOne:最难题集 0%,但已约一年未更新
- Esolang-bench:最高分 4.2%,疑似停止维护
作者想找更多 frontier 模型得分极低的活跃 benchmark,评论区可补充。
「研究」频道最新
- FuseReg:层融合正则化弥合表征自编码器的重建-生成鸿沟,gFID 降 29% — USC-PSI-Lab · 2026-09-28
- Kaggle 推出 Game Arena:用国际象棋、德州扑克、狼人杀对抗评测 LLM — kaggle · 2026-09-28
- InternW0-Δ 发布:20K+ 小时开放数据训练世界动作模型,将全面开源 — Xingyu Miao · 2026-09-28
- Berkeley 提出 Morphometric Imitation:人手示教零样本迁移到 3 种机器手,真机成功率 89.3% — Berkeley · 2026-09-28
- 长文:大脑蛋白尺度估算暗示每参数对应数百万分子开关单元 — JosephJacks_ · 2026-09-28
- 用对比式 InfoMax 替代像素重建,世界模型抗干扰且训练更省 — burny_tech · 2026-09-28