对齐研究者激辩:沙盒安全与目标塑造能力决定 ASI 对齐成败

8 月 19 日,AI 安全研究者 Jeremy Gillen 与 Jacques Thibs 在 X 上围绕前沿实验室的对齐策略展开多轮交锋,焦点集中在沙盒安全与 AI 目标塑造能力上。

已确认

为什么重要

这场争论触及对齐研究的两个关键假设:实验室能否可靠地塑造 AI 目标,以及沙盒环境是否足以在关键时刻约束高能力但失准的 AI。如果 Gillen 的质疑成立,前沿实验室的安全研究路径本身可能存在根本性障碍;而 Thibs 强调的时间窗口论则意味着沙盒安全不是工程细节,而是决定人类能否借失准 AI 完成对齐的胜负手。

2026-08-19 ~ 2026-08-19 · 5 条相关

一手来源

另有 1 条近重复转述:jeremygillen1