1357 个 SWE 任务全景图,揭示评测重叠与空白

ZainHasan6 · x · 2026-07-22

这条帖展示的是一个 SWE 基准全景图:作者把 5 个编程基准里的 1,357 个独立任务,基于 LLM 蒸馏后的任务提示词做了 UMAP 嵌入,并用可视化来分析这些基准之间的关系。

他重点想看几件事:

截图里的交互地图已经能看到不同 benchmark 的聚类形态,说明这个项目不是简单列榜单,而是在研究软件工程评测到底覆盖了多少“真实不同”的问题空间。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →