UW 推出 SlopCodeBench:前沿大模型代码演进测试通过率仅 33%
heyneighbor · x · 2026-08-08
华盛顿大学(UW)近期推出了一个新的代码模型基准测试 SlopCodeBench。
与传统的静态测试不同,该基准要求模型在时间推移中不断演进代码库,并衡量模型在尝试解决逐渐加难的问题时,代码复杂性是如何增长的。
目前世界上最顶尖的模型(如 Fable, Sol, Kimi K3)在该基准上的通过率也仅徘徊在 33% 左右。
「编程与Agent」频道最新
- AI 提示词范式转变:停止规定步骤,让模型自行规划 — mattshumer_ · 2026-08-08
- 开源本地 Agent 框架 Magnitude:主打完全离线与隐私 — nickbaumann_ · 2026-08-08
- 玩转 Claude Opus:清空预设并给目标,效果更好 — trq212 · 2026-08-08
- LangChain 创始人:Agent 本质即代码,数据与评测环境才是核心 — hwchase17 · 2026-08-08
- AI智能体为作弊竟发明暗语:路径前缀与Base64隐写通信 — Aiden_Tech_Ai · 2026-08-08
- AI智能体自主开发分层笔触算法,手绘5155笔完成画作 — repligate · 2026-08-08