Hadfield-Menell:新基准测的是爬山能力,不是「研究品味」
dhadfieldmenell · x · 2026-10-07
David Hadfield-Menell 回应 Asaf Benj 关于「研究品味」基准的争论。他承认该基准确实衡量了对「AI→AI 研发」反馈循环很重要的能力,但坚信用词应有准确含义——该基准实际测的是「对指标爬山」的直觉,而非真正意义上挑选重要研究问题的科学品味。
「漫话AGI」频道最新
- Roman Yampolskiy:奇迹不是 AI 会高等数学,而是人类曾经会 — romanyam · 2026-10-07
- Nat Eliason 设想「Alpha 艺术学院」:上午学术下午创作 — nateliason · 2026-10-07
- Neil Chilson 质疑末日论:你的信念如何被证伪? — neil_chilson · 2026-10-07
- 观点:组织的 token 效率直接决定其 AI 时代的安全防御能力 — sudoraohacker · 2026-10-07
- Naked Scientists 推出 Why AI 系列,Hinton 等四位大咖对谈 — wooldridgemike · 2026-10-07
- 「AI 数学进展慢」之争:反驳称缺预注册才显得慢,90 题已解属实 — Jsevillamol · 2026-10-07