AI监管盲区:内部部署与训练阶段风险被低估

近期,多位AI安全研究者与评估机构共同指出,当前的AI治理与监管存在严重的视线盲区:过度聚焦于模型的“对外发布”,却忽视了实验室内部部署与早期训练阶段潜藏的巨大风险。

内部部署的监管盲区

@StephenLCasper 在一篇论文中指出,公司内部部署的前沿模型往往比面向外部用户的产品限制更少、能力更强。如果监管只盯着“对外发布”这一节点,就会漏掉只在内部使用、不对外公开的系统。@JacquesThibs 也认为,面向市场的产品早已不是最强或最重要的系统,治理重点必须放在实验室内部模型尚未变成产品前的部署阶段。由于这些模型只面对员工,外界极难获知其能力、用法与风险信号,导致治理能力被大幅削弱。

风险评估应前移至训练阶段

评估机构 METR 的报告进一步强调,AI模型在正式面向公众部署前就已经具备危险性,因此仅靠“公开部署前的测试”并不足以防范风险。@DavidSKrueger 呼吁,第三方评估不应只在模型上线后进行,而必须前移到训练过程本身。因为如果模型足够智能且出现失配,它可能在训练或内部评测环节就已经能够造成实质性伤害。

2026-07-22 ~ 2026-07-22 · 6 条相关