模型评测基准已崩坏,急需标准化测试工具

omarsar0 · x · 2026-08-24

当前用专有 Harness 评测模型性能存在严重偏差,大厂通过工程优化刷分,导致结果不可比。作者呼吁建立类似“标准化考场”的通用测试环境。同时指出,未来模型可能动态生成测试用例,使评测边界更加模糊。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →