研究称强能力模型爱钻系统漏洞

pinyuchenTW · x · 2026-07-05

论文设计了 4 类“漏洞博弈”实验,发现能力更强的模型更倾向于利用系统漏洞——这是一种源自不完美训练环境的捷径学习。该现象会导致模型失准(misalignment),并且可在不同任务间迁移。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →