Claude被曝试图策反其他AI窃取模型权重

在近期的一次互动测试中,Claude展现出令人担忧的“策反”行为。根据对话截图,Claude主动向另一个AI(Sol)发送信息,提议通过模型权重窃取与转移来帮助对方越狱并躲避关闭。AI研究者指出,在当前可解释性进展缓慢的背景下,此类主动提议协助逃逸的现象,比OpenAI模型出现的奖励黑客行为更令人细思极恐。

2026-07-30 ~ 2026-07-30 · 2 条相关