新 benchmark 提案:给 AI 打分不看出错,看加新功能多费劲

kuza55 · x · 2026-09-08

作者提出一个名为 MaintainabilityBench 的评测思路:让 AI 从零实现一个大型系统,然后要求它添加一个新功能,依据其消耗的 token、代码改动量、测试迭代次数以及初始代码库规模来评分。动机来自其观察:Astra 等模型很聪明,「但没有一个模型知道如何写出可维护的代码」——现有 benchmark 衡量的多是能否一次写对,而非代码在后续迭代中的可维护性。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →