开发者自建 ChatGPT 评测 harness,忧训练数据污染需出新题
tak3sh8 · x · 2026-09-26
作者分享了搭建评测 harness 的乐趣,同时指出一个关键问题:ChatGPT 可能在训练中见过这些题目的解法,因此需要设计全新的问题来避免评测数据污染,获得可信的能力对比结果。
「模型」频道最新
- VraserX:Gemini 4 Pro 或称游戏设计最佳,但科学突破仍看 OpenAI — VraserX · 2026-09-26
- 有人痛批 AI Safety 是伪科学,争论焦点是 OpenAI 多智能体训练不透明 — basedjensen · 2026-09-26
- OpenAI 文档上线电话外呼能力,AI 可直接拨打号码代你通话 — imjustnewatai · 2026-09-26
- 烧掉 2 亿 token 才换 3000 万有用代码:重度用户谈 max 模型体验 — gaganghotra_ · 2026-09-26
- 开发者实测 Opus 5.5:需大量提示词迭代,账单翻倍回退旧模型 — bindureddy · 2026-09-26
- 一个提示词生成动态视频动画:「Opus 5.5」展示动画能力 — ghumare64 · 2026-09-26