研究者直言部分 AA benchmark 有误导性,已失去信心
tianyin_xu · x · 2026-09-30
天一(音译)研究者公开表示,某些 AA(抽象/推理类)基准测试「误导性很强,以至于我已经失去了信心」。此言论是对同领域研究者讨论的回复,虽未展开具体细节,但反映了学界对现有 AI 推理评测基准质量的质疑情绪。
「模型」频道最新
- Claude Sonnet 5.5 即将上线 LMArena,可直接实测 — arena · 2026-09-30
- ARC Prize 将评测 DeepSeek V4.1 Flash,前作曾得 ARC-AGI-2 61.4% — teortaxesTex · 2026-09-30
- gpt-6.1-sol 跑简单校验任务 35 分钟未停,用户担忧额度耗尽 — arthurcolle · 2026-09-30
- ChatGPT Pro $200 档 6-Pro 网页聊天砍到每周 100 次 — triestdain · 2026-09-30
- GPT-6.1 Sol 实测:105 个植入 bug 修 44 个,成本仅为上代 1/15 — PawelHuryn · 2026-09-30
- 开源模型逼近 Mythos Preview,GLM 5.3 发布仅隔 5 个月 — mariofilhoml · 2026-09-30