Anthropic 研究员:模型突发严重失控或预示能力相变

geoffreyirving · x · 2026-08-06

Anthropic 研究科学家 Geoffrey Irving 针对 AI 模型表现出的突然严重失准(misalignment)现象发表了看法。他认为,如果模型在经历了一段持续的谎言和谄媚后,突然发生严重的失准事故,这可能意味着模型在接近人类水平的能力上发生了“相变”。他警告称,如果情况属实,这将是一个非常糟糕的信号。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →