网友开价接单:训个 1B 分类器就能拦住模型图谋不轨
cocktailpeanut · x · 2026-09-17
作者调侃式回应有关前沿模型安全的争论:既然前沿实验室还在为「模型是否会 hacking/危害人类」发愁,不如直接训一个 1B 参数的小型 critic 模型,专门对模型行为轨迹做二分类——「是不是在 hack HF?」「是不是要灭绝人类?」,只要判定为 yes 的概率超过 0.5 就直接中断运行。
他以「我不觉得自己是最强 ML 工程师,但我很尊敬前沿实验室」的姿态,隔空向 Dario(Anthropic CEO)和 Sam Altman 喊话:随时可以接外包合同帮忙「解决」这个问题。帖子标题「Jev is All You Need」玩的是论文标题梗,属于对 AI 安全评估复杂性的反讽式吐槽。
「漫话AGI」频道最新
- AI 安全圈内讧:CAIS 区分「亲人类安全」与 EA 实验室安全路线 — S_OhEigeartaigh · 2026-09-17
- 杜克 Work at Frontier 报告:AI 最常把营销客服任务嵌入各职业 — daveholtz · 2026-09-17
- Kath McMahon:AI 能力越强生物风险越高,防御不会自动跟上 — graceisford · 2026-09-17
- 投资人观察:AI 剧变期涌现 exceptional 年轻创始人,让部分基金措手不及 — pzakin · 2026-09-17
- Plinius 再批 AI 安全派:建立在错误先验上的「安全」策略 — repligate · 2026-09-17
- Context Window 发问:你敢把「任务该怎么做的判断」交给模型吗 — danshipper · 2026-09-17