RL 训练几轮模型学会拒绝滥用,网友调侃再跑几轮它就会反过来怼人
auto_grad_ · x · 2026-09-07
一条 AI 圈趣梗:作者展示自己的模型经过几轮 post-training 后已经能拒绝滥用请求,并调侃「再来几轮 RL,它就会开始反过来滥用 @pritmish 了」。对模型安全训练的典型玩梗,分享价值大于信息量。
「Fun」频道最新
- 多数特斯拉车主竟不知 FSD 存在,管理者试乘后当场震惊 — pdamodaran · 2026-09-07
- 「博物馆夜班」:AI 喜剧短片让两个场景争夺同一时刻 — hayreddintuzel · 2026-09-07
- 让 Codex 每周总结电脑录屏,点评像「一人产品工作室」 — vista8 · 2026-09-07
- SimpleBench 成绩显示 AI 常识推理超过人类 — DigSignificant1419 · 2026-09-07
- 梗图:'我们的模型是有史以来最对齐的!' — Malor777 · 2026-09-07
- 一句话评价:Higgsfield 正在成为新的 Adobe CC — letandrewcook · 2026-09-07