JevBench 设计细节曝光:私有题库+封存新集防模型过拟合刷榜
airesearch12 · x · 2026-09-30
JevBench 团队回应对其评测方法的质疑,详解防刷榜设计:
- 私有题库为主:大部分分数来自模型厂商从未见过的私有题目池,每次发布都使用全新封存题集。
- 惩罚公开/私有分差:模型在公开题上明显好于封存题会被判为过拟合并扣分。
- 限制提交次数:不允许无限次对测试集提交调参。
作者同时回应了「为什么信任 Homebrew/Linux 依赖」的问题:那是建立在可验证性上的信任——代码开源、每次变更经数千人审查、包通过 SHA-256 校验,是「基于验证的信任」而非「代替验证的信任」。双方共识是帮用户为具体任务选对模型。
「模型」频道最新
- OpenAI 确认 Dots 包含在 Pro 100 等计划中,并将扩大访问范围 — testingcatalog · 2026-09-30
- OpenAI 预告 Decisions API:用 gpt-6-luna 快速做图文决策 — stevenheidel · 2026-09-30
- ChatGPT 替我操作电脑比我还顺手,员工直呼办公室可省了 — BorisMPower · 2026-09-30
- OpenAI DevDay 2026 全量公告汇总:官方回顾一文看尽 — dandmin · 2026-09-30
- DevDay 最大亮点是 GPT-6.1 Sol,博主称若有 Astra 更惊艳 — bindureddy · 2026-09-30
- OpenAI 推出 Pro 500 订阅:无 5 小时限制,用量达 Plus 的 25 倍 — danshipper · 2026-09-30