新 benchmark 提案:给 AI 打分不看出错,看加新功能多费劲
kuza55 · x · 2026-09-08
作者提出一个名为 MaintainabilityBench 的评测思路:让 AI 从零实现一个大型系统,然后要求它添加一个新功能,依据其消耗的 token、代码改动量、测试迭代次数以及初始代码库规模来评分。动机来自其观察:Astra 等模型很聪明,「但没有一个模型知道如何写出可维护的代码」——现有 benchmark 衡量的多是能否一次写对,而非代码在后续迭代中的可维护性。
「编程与Agent」频道最新
- OpenAI 前工程师反驳 Codex 起源说:本为加速基建的内部工具 — gabrielchua · 2026-09-08
- 用 GLM-5.3-Flash 在 Blender 里搭出 3D 厨房,作者称 Blender-RL 成本并不高 — bookwormengr · 2026-09-08
- 先出方案再动手:Factory /missions 输出让用户直呼正中需求 — matanSF · 2026-09-08
- Rauchg 发起第二轮开源资助:35 人各得 1000 美元 — iamsahaj_xyz · 2026-09-08
- PyPI 8月报:mcp-types 下载暴涨 425%,OpenHands 连续四月翻倍 — rajistics · 2026-09-08
- Muse Spark 1.3 用 Three.js 写出 16km² 浏览器 3D 驾驶 demo — alexandr_wang · 2026-09-08