为验证一个模型实测 16 家:一个任务构不成基准

AlexKim · x · 2026-09-19

作者为判断 TypeSafe 的 Jev 是否值得加入自己的技术栈,实测了 16 个模型,结果 Jev 准确率只排第 10。他分享了写结论的过程:初稿写「Haiku 更准」,这只在一个任务上成立;加测两个任务后结论变成平分秋色——Haiku 在业务类目上以 83.2 比 79.9 领先,Jev 在提交类型上以 50.0 比 42.0 胜出,散文类 66.0 打平。他的教训:一个任务构不成基准,标题要等数据 surv过后才能定。

所属事件:16 模型校准实测:Jev 快而诚实但准确率仅列第10(8 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →