SWE Verified 评测噪声再被指出,或有 5% 到 10% 无效样本
xeophon · x · 2026-07-25
这条和上一条本质上是同一事件的重复转引,仍然是在讲 SWE Verified 的样本质量问题。配图重复了核心结论:作者人工复核了难题样本后,认为基准集里可能存在 5%–10% 左右的无效样本。
它没有带来新的事实,只是再次强调了这个评测集的噪声问题。
所属事件:SWE-bench 评测集被指存在最高 10% 无效样本(2 条相关)→
「研究」频道最新
- 3D ResNet 论文八年突破 3000 引用,Kinetics 数据集成里程碑 — HirokatuKataoka · 2026-09-11
- 把数据调度变成优化的一部分:样本选择与排序影响 LLM 训练 — Puzzleheaded_Box2842 · 2026-09-11
- Jeff Heaton《神经网络数学导论》开放免费完整下载 — blaizedsouza · 2026-09-11
- 数学家 Daniel Litt 上线问题库,15 题仅 1 题被解,用来追踪 AI 解题进度 — littmath · 2026-09-11
- AI 智能体协作优化 secp256k1 量子电路,挑战打破 ECDSA — StefanoGogioso · 2026-09-11
- Alex Townsend 汇编 200 个数值线性代数开放问题,供人类与 AI 攻关 — IgorCarron · 2026-09-11