SlopCodeBench:LLM 代码正确却难看,如何量化代码烂度
mitsuhiko · x · 2026-09-11
Earendil 的 Sebastian 发布了对 SlopCodeBench 的研究笔记,探讨「编码已解决之后」的问题:LLM 生成的代码形式上正确,却常引入不必要的抽象、重复实现和糟糕决策,导致项目代码量爆炸式膨胀。
- 当项目每月新增数百万行代码时,人类已难以跟上,逐渐失去对代码库的主导权
- 更糟的是,agent 自己也无法有效清理这些 slop
- 作者以物理学的实证思路调研文献与业界做法,发现除少数论文外,行业对代码质量的评估仍高度「凭感觉」,与端到端 coding agent 的营销话术形成反差
- 核心目标是为代码「烂度」建立可量化的测量方法
「编程与Agent」频道最新
- ApprenticeBench:Agent 真实岗位持续学习已超越人类专家 — ysu_nlp · 2026-09-12
- Agora 开源会议 Copilot:GPT-Live-1 可边听边说、自动建任务 — testingcatalog · 2026-09-12
- GPT-Live-1 加入视频会议当参会者,实时转录答疑还能建任务 — testingcatalog · 2026-09-12
- 前工程管理者:我现在像带团队一样管理一群 Claude 和 Codex agent — letandrewcook · 2026-09-12
- 实测发现:astra 极度吃上下文,极简 prompt 反而大幅拉低表现 — brandon_galang · 2026-09-12
- DeepSeek 无官方编码 harness,社区版 Deep Code CLI 星标破 2.2k — PawelHuryn · 2026-09-11