33.3% ImageNet 图片含多个类别,研究者称答案集本身不完整
RexDouglass · x · 2026-09-03
研究者 klaaracz 指出,ImageNet 图片本身并不严格对应单一物体:33.3% 的图片包含超过一个 ImageNet 类别的对象(此前的重标注研究给出的数字是 14.9%-21.6%),另有 3.8% 的图片完全不包含任何 ImageNet 类别。这意味着我们一直在用一份不完整的标准答案给模型打分。
「模型」频道最新
- Fable 5.1 重写 LLM 腔文档,竟触发「普遍危害」安全护栏 — StewartalsopIII · 2026-09-03
- antirez 新作暂不上传 Hugging Face,先挂在自己网站上 — antirez · 2026-09-03
- 研究测 13 款主流 LLM:10%-35% 陈述因说话者性别被改判真假 — anthara_ai · 2026-09-03
- Claude Sonnet 5 出现错误率升高,Anthropic 正排查故障 — ClaudeAI-mod-bot · 2026-09-03
- 开发者实测 Fable 5.1:更快更便宜,但「写码已被解决」言过其实 — vboykis · 2026-09-03
- 腾讯混元 770B 模型量化后从 1.5TB 压到 214GiB — Aiden_Tech_Ai · 2026-09-03