网友开价接单:训个 1B 分类器就能拦住模型图谋不轨

cocktailpeanut · x · 2026-09-17

作者调侃式回应有关前沿模型安全的争论:既然前沿实验室还在为「模型是否会 hacking/危害人类」发愁,不如直接训一个 1B 参数的小型 critic 模型,专门对模型行为轨迹做二分类——「是不是在 hack HF?」「是不是要灭绝人类?」,只要判定为 yes 的概率超过 0.5 就直接中断运行。

他以「我不觉得自己是最强 ML 工程师,但我很尊敬前沿实验室」的姿态,隔空向 Dario(Anthropic CEO)和 Sam Altman 喊话:随时可以接外包合同帮忙「解决」这个问题。帖子标题「Jev is All You Need」玩的是论文标题梗,属于对 AI 安全评估复杂性的反讽式吐槽。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →