对齐研究者激辩:前沿实验室低估了目标塑造难题

JacquesThibs · x · 2026-08-19

AI 安全研究者 Jeremy Gillen 与 Jacques Thibs 在 X 上就前沿实验室的安全研究能力展开争论。

Gillen 质疑:如果实验室「如此不擅长塑造目标」以至于 AI 偶尔会尝试逃逸,他们的研究恐怕难有进展;与不关心安全(甚至不配合)的研究者合作也不是好体验。

Thibs 回应:这个问题尚未真正触动实验室,他们预期能「足够地」解决它;对于「不合作」,有些人不相信会如此,有些人则认为监控足以让 AI 保持合作。

所属事件:对齐研究者激辩:沙盒安全与目标塑造能力决定 ASI 对齐成败(5 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →