开发者怒批Base 1模型评测:无样本量与误差线,纯属产品更新

ziv_ravid · x · 2026-08-05

针对 Base 44 平台发布的自研模型 Base 1 的基准成绩,开发者 ziv ravid 提出了严厉批评。Base 1 声称在数百万构建者的生产环境 A/B 测试中,其应用构建成功率(74.9%)逼近甚至超越了部分竞品,且具有最低的“挫败感”。

但批评指出,这些数据完全没有提供样本量、误差线以及“成功”或“挫败感”的明确定义。由于外部人员无法审查或复现这些基于内部生产环境的测试,这种缺乏科学严谨性的成绩展示只能算作产品公关更新,根本不能称为真正的基准测试。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →