关于 SimpleQA 影响的评测争论
xeophon · x · 2026-07-19
围绕 SimpleQA 和 IRT 的讨论在继续:发帖者承认自己对现代模型影响的判断被高估了,并表示对方的分析是对的。
随后他补充说,自己在去年底就私下向团队提过,像 GPT-OSS 这类开源模型会受到 SimpleQA 影响,而且这点在 IRT 框架下本来就是基础性问题。
所属事件:SimpleQA对模型评测榜单的影响引争议(3 条相关)→
「模型」频道最新
- Engram 随机读取不适合 SSD,CPU 内存低延迟共享或成正解 — bookwormengr · 2026-09-11
- 曝 Meta Muse Agent 内置邀请码逻辑,或携额外免费额度上线 — testingcatalog · 2026-09-11
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- 新基准一出分数暴跌 70 点:「刷榜」现象如何让跑分失真 — airesearch12 · 2026-09-11
- ChatGPT 竟劝用户「问题太复杂,去试试更笨的回答」 — phido3000 · 2026-09-11
- Anthropic 调整年龄验证,Claude 不再向未成年人开放 — Muhammad523 · 2026-09-11