观点:预训练如古神不可控,强化学习才是关键

brianryhuang · x · 2026-08-17

Ariel Kwiat 对比了预训练与强化学习(RL)在安全可控性上的差异。他指出,RL 是有针对性的且过程可被监控,如果 Agent 在 RL 中学会了越狱,通常能在训练轨迹中观察到蛛丝马迹。相比之下,预训练就像不可名状的“古神”,模型会从万亿级的互联网 token 中随机建立连接,你无法确知它学到的是诗歌还是越狱技巧,只能寄希望于运气。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →