批 AI 评测如占星术,开源项目 BRONCO 欲建科学度量基准

KeilerHirsch · reddit · 2026-08-13

开发者批评当前的 AI 评测文化充斥着营销包装,例如将 SWE-bench 的得分直接等同于「模型达到了资深工程师水平」。

为此,他发起了开源项目 BRONCO,试图建立真正科学的 AI 度量学(Metrology)。项目聚焦于可重复性、不确定性、建构效度和溯源能力,并基于 DIN/ISO/IEC 标准构建。其核心逻辑采用极简的 Ada/SPARK 可信内核编写,以确保度量关键逻辑的绝对严谨。项目目前处于早期研究阶段,旨在先证明「尺子是直的」,再去做排行榜。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →