BenchmarkList上线汇总AI基准
davidtsong · x · 2026-07-16
BenchmarkList 上线:一个集中追踪 AI benchmarks、模型和能力的站点。项目方称已汇总 2,400+ 分散在论文、网站和帖子里的 benchmarks,并支持:
- 跟踪新 benchmark 和新模型
- 横向比较不同模型表现
- 将 AI 进展映射到人类工作任务上
所属事件:BenchmarkList 上线汇总 2400 余个 AI 评测基准(4 条相关)→
「公司和人」频道最新
- 法学教授谈 legal engineering 岗位:离开执业后再回律所仍受偏见 — jkubicki · 2026-09-11
- 安全从业者被讽「只会发帖不设防」,AI Safety 圈爆发职责之争 — Dan_Jeffries1 · 2026-09-11
- 孙正义:人类是最高级生命形式的时代即将终结 — Puzzleheaded-King584 · 2026-09-11
- IIT马德拉斯推出 EdTech Tulna AI 教育产品评估标准 — ravi_iitm · 2026-09-11
- Warp 六个非工程团队全用 Linear 和 Claude Code 工程化运作 — mon__lim · 2026-09-11
- Anthropic 内部爆料:并非人人都持高 p(doom) 灾难论 — anpaure · 2026-09-11