修个 grader 分数翻倍,剩下 20% 竟是任务本身的错误
xeophon · x · 2026-09-17
xeophon 自曝:今天仅靠修复一个简单的评测 grader 就让分数翻了一倍,并讽刺剩下的 20% 分差是任务本身存在的错误。这条吐槽直指 AI 评测中 grader 质量与 benchmark 可靠性的普遍问题——分数波动可能更多来自评测器缺陷而非模型能力差异。
所属事件:修一个 grader 评测分数翻倍,AI 评测质量再遭吐槽(3 条相关)→
「模型」频道最新
- Jev 实测:路由延迟比 GPT-5.6 低 95%,可实时监测 agent 切换模型 — pwendell · 2026-09-17
- AndroidLife 实测:Qwen3.8-27b 操作真手机 60 任务成功率仅 56.7% — East-Muffin-6472 · 2026-09-17
- 新论文:主流 LLM 能否像人类一样通过认知发展测试 — GolinoHudson · 2026-09-17
- 观点:前沿 LLM 又慢又贵,小模型才是工作流主力 — TejasKumar_ · 2026-09-17
- OpenAI 将模型“捍卫人类文化”判为错位,引发争论 — RachelVT42 · 2026-09-17
- 「读取模型真实置信度」被戳穿:所谓 confidence 就是 logit 熵 — mgostIH · 2026-09-17