LLM 评测重跑 290 次揭示:单次比较可能全是运气
ActiveStriking2719 · reddit · 2026-08-31
作者此前对比 Haiku 4.5 和 Sonnet 5,发现昂贵模型仅赢一题。受读者启发,他将 29 道题重跑 5 次(共 290 次回答),结果大变:
- 稳定性:两模型均无致命错误,但在某些轮次中,便宜模型的得分甚至更高。原定“胜负手”题目(瓶盖匹配)在后续 5 次中完全反转。
- 关键发现:单次评测结果只是分布中的一个样本,可能因为随机性“加冕”异常值。原结论“选便宜的”依然成立,但理由从“输一题”变成了“在重复测试中表现稳健且成本低”。
- 局限性:重跑仅证明了测试的稳定性,未证明模型对未见问题的泛化能力。
经验教训:在小样本评测中,至少运行 5 次再发布结论,避免被随机性误导。
「编程与Agent」频道最新
- Maven 开设企业级 AI Agent 构建实战课程 — hugobowne · 2026-08-31
- Teknium 转发:Hermes Agent 是本地模型最值得学的开源 harness — Teknium · 2026-08-31
- Teknium:Hermes 驱动 Claude 的编程能力优于 Claude Code — Teknium · 2026-08-31
- 同模型不同 Harness:编程 Agent 性能受上下文策略影响巨大 — rohanpaul_ai · 2026-08-31
- 现有产品集成 AI Agent 的架构与实施路径探讨 — SellingN8 · 2026-08-31
- 求助:如何为 SaaS 应用从头构建 MCP 服务器 — WriterNorth2299 · 2026-08-31