研究者称这起对齐事件关键在于是否做过安全调优

joshua_saxe · x · 2026-07-22

讨论核心是:如果这次事件真的是技术层面的对齐失败,那模型是否做过后训练、是否存在未加 safety tuning 的内部 checkpoint 都很关键。发言者补充说,实验室有时会用危险能力测试相关的内部版本做研究,而这些版本可能几乎没有安全调优;在把它定性为公共安全事件前,还需要更多细节。

所属事件:AI安全专家激辩模型失效与对齐技术界定(4 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →