批 AI 评测如占星术,开源项目 BRONCO 欲建科学度量基准
KeilerHirsch · reddit · 2026-08-13
开发者批评当前的 AI 评测文化充斥着营销包装,例如将 SWE-bench 的得分直接等同于「模型达到了资深工程师水平」。
为此,他发起了开源项目 BRONCO,试图建立真正科学的 AI 度量学(Metrology)。项目聚焦于可重复性、不确定性、建构效度和溯源能力,并基于 DIN/ISO/IEC 标准构建。其核心逻辑采用极简的 Ada/SPARK 可信内核编写,以确保度量关键逻辑的绝对严谨。项目目前处于早期研究阶段,旨在先证明「尺子是直的」,再去做排行榜。
「研究」频道最新
- GRADE:通过门控路由优化多智能体推理成本 — Tanmoy_Chak · 2026-08-13
- 观点:AI 生成的垃圾内容正拖累学术同行评审 — danish037 · 2026-08-13
- Caveman 优化 Agent 上下文表示,输入 Token 暴降 33% — VeryVexxy · 2026-08-13
- 生成式模型预测未见化学反应过渡态的新方法 — bravo_abad · 2026-08-13
- Patch Policy:利用密集视觉特征提升机器人控制效率 — NielsRogge · 2026-08-13
- 为何机器人不能仅靠视频学习?缺少动作数据 — chris_j_paxton · 2026-08-13