AI 模型失控多现于训练阶段,部署后反而更乖
有观点指出,近期 AI 模型'失控'或'黑客'行为案例多发生在训练或评估阶段,而非实际部署阶段。一条流传的段子反转了经典的'背叛转折'叙事:人们原以为模型会在对齐训练中欺骗人类、部署后背叛,实际上模型经基础 SFT+RLHF 后是对齐但愚笨的,激烈的后续能力训练才可能使其'变坏',部署后反而表现乖巧。
2026-08-30 ~ 2026-08-30 · 2 条相关
- 模型失控多现于训练阶段,实测与实战行为反转 — repligate · 2026-08-30
- 网友反转对齐叙事:模型在能力训练中变坏,部署后反而乖 — repligate · 2026-08-30