开发者怒批Base 1模型评测:无样本量与误差线,纯属产品更新
ziv_ravid · x · 2026-08-05
针对 Base 44 平台发布的自研模型 Base 1 的基准成绩,开发者 ziv ravid 提出了严厉批评。Base 1 声称在数百万构建者的生产环境 A/B 测试中,其应用构建成功率(74.9%)逼近甚至超越了部分竞品,且具有最低的“挫败感”。
但批评指出,这些数据完全没有提供样本量、误差线以及“成功”或“挫败感”的明确定义。由于外部人员无法审查或复现这些基于内部生产环境的测试,这种缺乏科学严谨性的成绩展示只能算作产品公关更新,根本不能称为真正的基准测试。
「模型」频道最新
- 英伟达开源 Alpamayo 2 自动驾驶推理模型 — CodeByPoonam · 2026-08-05
- AI 编程趋势:从寻找全能王转向按需匹配 — ingliguori · 2026-08-05
- LiquidAI 发布 LFM2.5-2.6B 端侧模型 — LiquidAI · 2026-08-05
- shadcn:宁愿牺牲跑分也要换取更低延迟 — shadcn · 2026-08-05
- 传 SSI 研发在线学习,GPT-6 或于本月亮相 — flowersslop · 2026-08-05
- Hugging Face 上线优化版 MiniMax H3 演示空间 — mrfakename0 · 2026-08-05