对齐研究者:AI 风险集中于新预训练与强智能体 RL
可解释性研究者 menhguin 重申,超过 90% 的 AI 风险集中在新型大规模预训练运行和新型后训练方法(如强智能体 RL)的大规模部署上,因为这些会带来能力跃变并出现未知风险。另一研究者提出「对齐的死亡之谷」观点:已知风险实验室都有资源应对,真正致命的是人类无法预见的未知风险,只有前沿大模型自己才可能预测这些风险,因此对齐工作必须前移到预训练阶段。
2026-09-27 ~ 2026-09-27 · 2 条相关
- 对齐研究者:新预训练+强智能体RL是AI风险集中区 — menhguin · 2026-09-27
- 对齐的「死亡之谷」:论对齐必须前移到预训练阶段 — menhguin · 2026-09-27