LLM 评测重跑 290 次揭示:单次比较可能全是运气

ActiveStriking2719 · reddit · 2026-08-31

作者此前对比 Haiku 4.5 和 Sonnet 5,发现昂贵模型仅赢一题。受读者启发,他将 29 道题重跑 5 次(共 290 次回答),结果大变:

经验教训:在小样本评测中,至少运行 5 次再发布结论,避免被随机性误导。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →