JevBench 评测者:多数模型输在设置与校准等低级失误
airesearch12 · x · 2026-09-27
跑了几十个 Jev-class 模型的评测后,作者发现模型作者普遍错过容易的改进点:设置不当、选项处理、校准问题、速度/成本权衡没调好——这些都能明显提升排名。作者表示无法逐一反馈,但模型作者若预约 JevBench / ImageJevBench 的专门评测,会附带他的观察笔记与改进建议。他强调这纯属技术建议,评测保持公平独立、排名不可被影响,试图贿赂买排名者将被移出榜单。
「研究」频道最新
- Spatial-Interactor:让 VLM 像婴儿一样通过交互学会空间推理 — arankomatsuzaki · 2026-09-27
- DeepMind 研究员析 AI 未撼动物理学:真突破需人类知识凸包外洞见 — DaniloJRezende · 2026-09-27
- WTF 框架微调流模型,奖励对齐训练算力最高省 280 倍 — yeewhye · 2026-09-27
- IIT 德里 4 篇 NeurIPS 2026 主会论文:多语言可解释性与蒸馏新方法 — Tanmoy_Chak · 2026-09-27
- NeurIPS 2026 论文:稀疏层是 Looped 语言模型规模化的关键 — burny_tech · 2026-09-27
- 芬兰 2000 人研究:高频用 AI 与工作倦怠并无明显关联 — derrikson · 2026-09-27