SlopCodeBench 引关注:专测多轮代码退化的新型基准
cedric_chee · x · 2026-09-13
开发者 Cedric Chee 深入查看了 SlopCodeBench 的文档、题集和仓库后给出好评,称设计好的评测非常难,而这套基准做得不错。
- 背景:此前有报告称 GPT-6 Astra 生成的代码会随多轮对话逐渐膨胀、退化,还出现一些取巧的「代码高尔夫」行为,正是这类现象催生了对多轮代码质量评测的需求。
- 基准内容:题目按 checkpoint 划分(如示例题 pwd-manager 要求用 Python 构建交互式加密密码管理器),覆盖 Python/JavaScript/Java/C++/Go 多语言,按难度和类别(cli-tools 等)组织,可对比 GPT-6 Astra、Fable 5.1、GPT-5.6 Sol、GLM-5.3 等模型在长任务中的表现。
「编程与Agent」频道最新
- 用户晒全程语音 agent 购物:本周网购 100% 通过 Muse 完成 — armand_ruiz · 2026-09-13
- 纯 Rust 写的 AI 模块化合成器:带完整 MCP 接入 — simply-chris · 2026-09-13
- yacine 晒纯手机对话 AI 完成的第三版 CAD 设计 — yacineMTB · 2026-09-13
- CoreWeave Hacks 开幕:200+ 开发者 24 小时造「能自我纠错」的 Agent — wandb · 2026-09-13
- 开发者用 Rork 重构 2019 年旧应用:AI 时代上架效率大增 — rudrank · 2026-09-13
- 让 agent 把截图拼成联络表省 token,大幅减少图片读取开销 — pvncher · 2026-09-13