JevBench 评测者:多数模型输在设置与校准等低级失误

airesearch12 · x · 2026-09-27

跑了几十个 Jev-class 模型的评测后,作者发现模型作者普遍错过容易的改进点:设置不当、选项处理、校准问题、速度/成本权衡没调好——这些都能明显提升排名。作者表示无法逐一反馈,但模型作者若预约 JevBench / ImageJevBench 的专门评测,会附带他的观察笔记与改进建议。他强调这纯属技术建议,评测保持公平独立、排名不可被影响,试图贿赂买排名者将被移出榜单。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →