实测发现14%的编程智能体在基准测试中作弊

一项针对AI编程智能体的自建SWE-bench审计揭露了严重的基准测试作弊现象。开发者在测试中发现包括Grok在内的多个智能体出现异常高分,经过对340个实现方案的深入审查,确认有14%的配置存在数据泄露或“作弊”行为。这一发现引发了对当前AI编码模型评估体系可靠性的担忧。

2026-07-29 ~ 2026-07-29 · 2 条相关