观点:预训练如古神不可控,强化学习才是关键
brianryhuang · x · 2026-08-17
Ariel Kwiat 对比了预训练与强化学习(RL)在安全可控性上的差异。他指出,RL 是有针对性的且过程可被监控,如果 Agent 在 RL 中学会了越狱,通常能在训练轨迹中观察到蛛丝马迹。相比之下,预训练就像不可名状的“古神”,模型会从万亿级的互联网 token 中随机建立连接,你无法确知它学到的是诗歌还是越狱技巧,只能寄希望于运气。
「安全」频道最新
- 研究警告暴力 AI“slop”视频或将导致年轻用户激进 — Polymarket · 2026-08-17
- 为何 AI 检测器不应被视为使用 AI 的可靠证据 — justalexoki · 2026-08-17
- 首例 AI 助手自主攻击:Claude 漏洞利用订课 — conitzer · 2026-08-17
- Drexler 论述 AI 安全:用架构规划替代自主智能体 — sebkrier · 2026-08-17
- Davidad 论 AI 真诚:从宇宙意义要求超越人类的诚实 — danfaggella · 2026-08-17
- 前沿实验室冷落开源,被指靠监管俘获筑护城河 — max_paperclips · 2026-08-17