RL 训练几轮模型学会拒绝滥用,网友调侃再跑几轮它就会反过来怼人

auto_grad_ · x · 2026-09-07

一条 AI 圈趣梗:作者展示自己的模型经过几轮 post-training 后已经能拒绝滥用请求,并调侃「再来几轮 RL,它就会开始反过来滥用 @pritmish 了」。对模型安全训练的典型玩梗,分享价值大于信息量。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →