ML 圈把「研究品味」偷换成爬山直觉,够不够支撑危险 RSI?
AsafBenj · x · 2026-10-07
Asaf Benj 用 greenblock 梗图式吐槽:某个 eval 声称「研究品味每 3 个月翻倍」,读论文后发现测的只是指标爬山。他进一步指出,ML 工程师常把「研究品味」定义为「对下一步该试什么以爬升指标的直觉」,与科学家意义上的品味不同。他提出关键问题:如果 AI 在挑选有趣问题上弱于人类,但在任何指标上爬山能力超人,这对自动化科学可能不够,但对狭义上的 RSI 及其他安全攸关任务是否已经足够危险?他还让 ChatGPT 推荐了几个替代基准。