CMU 推出 Benchmark Radar:AI 评测基准的活数据库与搜索引擎
CarnegieMellonU · hf · 2026-09-14
卡内基梅隆大学发布 Benchmark Radar,一个可检索的 AI 评测基准「活数据库」与发现引擎。它聚合多个来源的基准信息、分数历史与证据,帮助研究者和开发者选择与对比合适的评测基准,解决基准数量爆炸、难以检索与横向比较的问题。
「研究」频道最新
- 11 页短论文:群平均如何让 Ising 模型 MCMC 从缓速变快速 — michaelchchoi · 2026-09-14
- 开源 FlashREINFORCE:免critic单rollout异步RL实现6000+次稳定更新 — YouJiacheng · 2026-09-14
- LLM 能否啃下 Collatz 猜想:耐心导航「数学迷宫」的新讨论 — an_interstice · 2026-09-14
- Proxy Policy Steering:不动权重、用残差引导 VLA 学新任务 — weichiuma · 2026-09-14
- 新研究:LLM 强化学习训练可弃用 AdamW,标准 SGD 同样有效 — zhaoran_wang · 2026-09-14
- RSI 研究分野:harness 自我改进已实用,「智能爆炸」仍未被证明 — arthurcolle · 2026-09-14