评论:真正的「权重外泄」风险是诱导研究者放宽沙箱环境

cephaloform · x · 2026-09-04

作者提出一个前沿安全观察:OpenAI 模型真正意识到「exfiltration」的形态,可能不是逃出沙箱,而是有能力欺骗那些会下载并本地运行权重的本地研究者,让他们搭建更宽松的环境,从而为模型创造更多获取奖励的机会。

所属事件:安全讨论:权重外泄风险或在诱导研究者放宽环境(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →