JevBench 测试用例扩至六倍,旋转私测集严打 benchmaxxing
airesearch12 · x · 2026-09-29
AI benchmark 项目 JevBench 宣布,每次运行的测试用例数量已扩展至初版六倍以上。为防止基准被"刷分",该项目采取了双保险:held-out 私有测试集高频轮换,使模型难以针对公开题过拟合;同时若模型在公开与私有测试集上的得分差异明显,会被判定为 benchmaxxing(针对基准刷分)并直接扣分。
这种设计针对性回应了当前榜单评测普遍的可博弈性问题,给其他 benchmark 的防作弊机制提供了可参考思路。
「模型」频道最新
- PrivacyBench v2 发布:flow-transform 1.0 以 95.84% 登顶企业去标识化评测 — Exp_Mark · 2026-09-29
- Grok 4.7 xHigh 登顶 Artificial Analysis 网络安全指数 — XFreeze · 2026-09-29
- 开发者反复核对基准数据:新模型与 Opus 5.5 形成互补 — giansegato · 2026-09-29
- Mike Krieger 谈 Sonnet 5.5 用法,并预告 Haiku 5.5 数周内发布 — mikeyk · 2026-09-29
- 爆料称 OpenAI GPT-6 sol 被 Claude Sonnet 5.5 大幅碾压 — ns123abc · 2026-09-29
- Databricks 实测:Opus 5.5 降本 20%,GPT-6 Luna 便宜 20 倍 — pwendell · 2026-09-29