质疑 AI 编程评测基准:数据集覆盖少且不实用
sergeykarayev · x · 2026-09-01
针对前述关于“前沿编码模型”的结论,Sergey Karayev 指出其依赖的基准数据存在问题:
- deepswe-bench:使用 mini-swe-agent harness,但现实中几乎没人用这个工具。
- terminal-bench 2.1:结果数量极少(约 60 个),对 harness 和模型的覆盖非常稀疏。
- Code QA benchmark:链接指向的代码问答基准看起来质量不佳。
作者提醒,仅基于这些有缺陷的基准做重大决策需谨慎。
所属事件:人机编码模型评测引争议:基准数据被指不实用(2 条相关)→
「编程与Agent」频道最新
- 实测:Qwen 27B 在配置调试中一次性修复了 DSV4 无法解决的问题 — OvertaxedOne · 2026-09-01
- AI 智能体现状:效果惊艳但仍需大量人工干预 — Hot-Cup3451 · 2026-09-01
- SOTA 智能体爱写无用代码,我们需要精确定义「坏代码」 — alexisgallagher · 2026-09-01
- 开发者分享 HTML 转 PPTX 方案:基于 pptxgenjs 定制 — dotey · 2026-09-01
- 开发者观察:代码 AI 输出仍存愚蠢决策,盲用风险高 — rickasaurus · 2026-09-01
- Anthropic 黑客松实测:AI 能否一次生成 Unity 3D 游戏 — davidfromkansas · 2026-09-01