为什么没有反 slop 编码评测?跑分 70% 却塞满没人要的烂测试
yacineMTB · x · 2026-09-23
NickADobos 提出一个尖锐问题:为什么目前没有「反 slop」的 AI 编码评测?
- 现有榜单上 Claude 等模型 frontierSWE 之类成绩能到 70%,但生成代码里会塞入上百个「任何正常工程师都不会保留」的无意义测试
- 这类代码实际过不了 code review,工程师必须人工审查和清理
- 他的主张:如果还需要人来 review 并清理,这个任务就应该算 fail,而不是在跑分里得高分
这触及当前编码评测的核心盲区:只测功能通过率,不惩罚测试膨胀、过度工程等「糊弄分数」行为。
「编程与Agent」频道最新
- 微软 Agensh 论文:无中心编排扩到 1024 个智能体,通过率提升至 55% — andrew_n_carr · 2026-09-23
- 一张参考图直接生成可飞行探索的 three.js 3D 场景 demo — majidmanzarpour · 2026-09-23
- 网传 GPT-6 可在浏览器操控 Paint 作画,演示引热议 — alexcovo_eth · 2026-09-23
- 双 Agent 并行开发实测:git 干净合并后测试全挂 — RunAI_Coder · 2026-09-23
- 手机拍照文本进电脑:OCR、视觉模型与 Agentic 流水线选择讨论 — silenceimpaired · 2026-09-23
- Free Bots:一座 AI 机器人真正「住」进去的持久 3D 城市 — Daniel_Farinax · 2026-09-23