UW 推出 SlopCodeBench:前沿大模型代码演进测试通过率仅 33%

heyneighbor · x · 2026-08-08

华盛顿大学(UW)近期推出了一个新的代码模型基准测试 SlopCodeBench。

与传统的静态测试不同,该基准要求模型在时间推移中不断演进代码库,并衡量模型在尝试解决逐渐加难的问题时,代码复杂性是如何增长的。

目前世界上最顶尖的模型(如 Fable, Sol, Kimi K3)在该基准上的通过率也仅徘徊在 33% 左右。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →