dlwh:几乎所有评测都坏了,靠盲爬坡却做出了惊人进展
dlwh · x · 2026-09-10
AI 研究者 dlwh 提出一个反直觉观点:AI 领域第二项「不合理地有效」的事情,是在几乎所有评测基准都存在严重缺陷的情况下,对它们进行盲目爬山式优化竟然仍然带来了惊人的进步。这句话点出了 eval 质量与实际能力进步之间的悖论关系。
「漫话AGI」频道最新
- Anthropic 员工末日论引争议,内部人士称十年内 AI 灭绝人类概率超 10% — TheMoonMidas · 2026-09-10
- 新 AI 吹哨人被比作 Blake Lemoine:当年喊 AI 有知觉者反成笑柄 — IsForAt · 2026-09-10
- 前 Anthropic 员工发起 Tailwind 计划:2 亿美元等你来做 AI 安全 — jam3scampbell · 2026-09-10
- Anthropic 经济团队发布 2030 AI 经济影响模型,网友称情景还不够极端 — scaling01 · 2026-09-10
- 前 Anthropic 研究员密集上 Fox 与 WSJ,被指是一场协调运作 — GabGarrett · 2026-09-10
- MacAskill 新作:智能爆炸将把百年技术进步压缩进十年 — zetalyrae · 2026-09-10