BenchmarkList 聚合 2400+ 基准
davidtsong · x · 2026-07-16
他们上线了 BenchmarkList,目标是把分散在论文、网站和帖子里的 AI benchmark 统一到一个地方。
当前已聚合 2400+ 个 benchmark,支持:
- 跟踪新的 benchmark 和模型
- 横向比较模型表现
- 把 AI 进展映射到人类工作的能力需求上
所属事件:BenchmarkList 上线汇总 2400 余个 AI 评测基准(4 条相关)→
「研究」频道最新
- 早在 2016 年 Robin Sloan 就用 RNN 做过 AI 写作补全插件 — jackclarkSF · 2026-09-11
- SlopCodeBench:LLM 代码正确却难看,如何量化代码烂度 — mitsuhiko · 2026-09-11
- 微软论文:给 Agent 记忆管理器加只读校验工具,Copilot 通过率 39%→73% — dair_ai · 2026-09-11
- 耶鲁 NLP 发布 IdeaAMBIG:评测 LLM 识别研究规格缺失细节的能力 — yale-nlp · 2026-09-11
- 借 SAM 2 分割掩码免训练估计单应性,跟踪精度大幅破纪录 — ducha_aiki · 2026-09-11
- 扩散模型真的更省数据吗?两条训练效率账被摊开算 — mgostIH · 2026-09-11