SWE Verified 评测噪声再被指出,或有 5% 到 10% 无效样本
xeophon · x · 2026-07-25
这条和上一条本质上是同一事件的重复转引,仍然是在讲 SWE Verified 的样本质量问题。配图重复了核心结论:作者人工复核了难题样本后,认为基准集里可能存在 5%–10% 左右的无效样本。
它没有带来新的事实,只是再次强调了这个评测集的噪声问题。
所属事件:SWE-bench 评测集被指存在最高 10% 无效样本(2 条相关)→
「研究」频道最新
- 新加坡国立大学做出无电子无外部供能软力传感器 — CurieuxExplorer · 2026-07-27
- Chelsea Finn:机器人 RL 的瓶颈是物理 rollout 成本 — ycombinator · 2026-07-27
- ICML 2026 口头论文复现分数重算后仍偏中等 — profjamesevans · 2026-07-27
- 长周期智能体最终需要不可变事件日志 — sebpaquet · 2026-07-27
- Seed IQ 在 Doom II 里通关,引出 ARC-AGI 之后的评测问题 — Fit_Transition8824 · 2026-07-27
- 实测智能体数据科学工作流:代码能跑但常答错问题 — hugobowne · 2026-07-27