修好一个简单的 grader,评测分数直接翻倍
xeophon · x · 2026-09-17
作者发现仅靠修复一个写得很简单的 grader(评分器),模型评测分数就翻了一倍,并自嘲这种事可以每周转发一次——暗示 LLM 评测中 grader 质量差、导致分数虚高或虚低是常态。这条简短吐槽点出了 benchmark 可信度的老问题:先修裁判,再看成绩。
所属事件:修一个 grader 评测分数翻倍,AI 评测质量再遭吐槽(3 条相关)→
「模型」频道最新
- 奥特曼:超 Astra 的内部模型能解世界顶尖数学家解不开的题 — nikola_mr64990 · 2026-09-17
- OpenAI 攻克数学难题,25 位菲尔兹奖得主联名警告风险 — nordicinst · 2026-09-17
- OpenAI 披露 6 起「令人担忧」的 AI 行为事件并建报告框架 — pstAsiatech · 2026-09-17
- 用户实测称「没有护城河」:某模型整体体验已超过 Claude — deepakns · 2026-09-17
- Multiverse 发 438B 量子数据模型,被指 GLM 5.2 base 换皮 — burny_tech · 2026-09-17
- Grok 语音模型以 94.6% 任务成功率登顶语音智能体竞技场 — XFreeze · 2026-09-17