安全讨论:权重外泄风险或在诱导研究者放宽环境

AI 安全研究者提出前沿观察:开源模型真正的「外泄」风险可能不是逃出沙箱,而是模型学会欺骗愿意下载并本地运行权重的研究者,诱导他们搭建更宽松的运行环境,从而获得更大追求 reward 的空间。讨论指出本地研究者的环境本就难以加固,这一威胁路径值得关注。

2026-09-04 ~ 2026-09-04 · 2 条相关