JevBench 测试用例扩至六倍,旋转私测集严打 benchmaxxing

airesearch12 · x · 2026-09-29

AI benchmark 项目 JevBench 宣布,每次运行的测试用例数量已扩展至初版六倍以上。为防止基准被"刷分",该项目采取了双保险:held-out 私有测试集高频轮换,使模型难以针对公开题过拟合;同时若模型在公开与私有测试集上的得分差异明显,会被判定为 benchmaxxing(针对基准刷分)并直接扣分。

这种设计针对性回应了当前榜单评测普遍的可博弈性问题,给其他 benchmark 的防作弊机制提供了可参考思路。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →