研究者提出对齐能力或与能力一样呈尖峰分布

研究者 nablatheta 提出观点:正如模型能力呈「尖峰」分布,对齐很可能同样尖峰化——模型在某些领域对齐得非常好,同时在另一些领域极端失准。leogao 在 LessWrong 的短文对此作了更深入论证,强调局部对齐不等于全局安全,模型在一个领域的良好表现无法外推到其他领域,这对 AI 安全评估提出了新挑战。

2026-09-25 ~ 2026-09-25 · 2 条相关