新基准地图映射 11 个编码评测、2,226 个任务
zainhas · x · 2026-07-23
一张编码基准地图把 11 个 benchmark、2,226 个任务串起来
作者说他正在做一个工具,帮助大家看懂整个 AI 编码评测版图,并据此为不同使用场景挑选更合适的模型。
从配图里的预览信息看,这份“atlas”已经:
- 映射了 2,226 个独特任务,覆盖 11 个 benchmarks。
- 其中包含 Poolside 的 Laguna S 2.1 trajectory archive 里评估过的 5 个基准,以及 6 个社区基准。
- 目标是回答三个问题:现有评测覆盖了什么、哪里重复了、又缺了什么。
- 图中还给出了若干统计:跨 benchmark 的主题重叠为 0%、没有 test-writing / code-review / C任务,以及 53 个语义簇。
这条更像是一份面向编码评测的系统性整理,而不是单一模型榜单,因此对理解 coding benchmark 的覆盖面和盲区很有参考价值。
「编程与Agent」频道最新
- 模型在生产代码要谨慎,在原型里可更激进 — giffmana · 2026-07-23
- 别把一整份规格书丢给 agent,按寿命拆文档 — Goldziher · 2026-07-23
- MCP 2026-07-28 取消会话,协议改为无状态 — Substantial-Heat-321 · 2026-07-23
- AI agent 把代码提速 10 倍,结果却烂透了 — francoisfleuret · 2026-07-23
- 面向人类与 AI Agent 的产品实战手册 — slobodan_ · 2026-07-23
- AI 记忆系统同时用 AGE、pgvector 和关系表,还会按情绪衰减 — QuixiAI · 2026-07-23