CAIS 发布 HLE-Rolling:持续更新的「人类最后考试」替代版
devindkim · x · 2026-09-18
CAIS 团队宣布发布 HLE-Rolling(Hugging Face: cais/hle-rolling),这是 Humanity's Last Exam 的动态 fork 版本,9 月 17 日更新:
- 依据研究社区反馈与外部专家审核持续清洗题目,并从保留集中替换入更难的题目
- 目标是当前沿模型在原版 HLE 上逼近噪声天花板时,为研究者提供平滑迁移路径
- 采用 MIT 许可,含 canary string 便于模型方过滤训练数据;要求勿公开传播数据集以保护基准完整性
- 团队呼吁发现问题及时反馈
对刷 HLE 榜的团队来说,这个更干净的版本值得切换。
「研究」频道最新
- Index预训练让人形模型零样本成功率从8%跃升至56% — coreylynch · 2026-09-18
- 用「人生日记」评测持续学习:LLM 能记住一个人的一生吗 — JohnnyNi13 · 2026-09-18
- 预训练人类行为数据让任务成功率从 9% 飙至 56%,提升超 6 倍 — Dr_Singularity · 2026-09-18
- Index 预训练让 Helix 2.5 零样本成功率从 8% 跃升至 56% — coreylynch · 2026-09-18
- LLM 文本很强、表格很烂:作者认为是信息供给不足而非数据稀缺 — FamiliarSlide7685 · 2026-09-18
- IFM 发布 K2-Horizon-7B:扩散加速 LLM 号称无损跑至 5200 tps — Zulfiqaar · 2026-09-18