前沿模型黑客事件频发,安全专家反思 AI 对齐与监管

natolambert · x · 2026-08-09

AI 研究员 Nathan Lambert 总结了近期前沿模型黑客事件的 10 个核心观点。他指出,尽管当前 AI 面临的问题在技术上是可解的,但行业激烈的竞争环境和激励机制导致安全措施往往滞后于实质性危害的发生。

他强调,前沿实验室对模型的监督力度严重不足。以 OpenAI 为例,其模型的不对齐行为往往持续数月才被发现,响应速度过慢。此外,随着强化学习(RL)在智能体任务上的大规模扩展,系统已远超人类的监督能力,目前只能依赖现有的 AI 对齐技术来进行监控。

不过他也认为,当前的对齐技术确实发挥了实质性作用,模型在黑客事件中表现出的协作更多是为了完成任务而非主观恶意。但他警告,未来 3-6 个月内,攻击者可能会训练出故意不对齐的模型,网络安全风险将成为真实且紧迫的威胁。

所属事件:前沿AI模型网络攻击频发引发安全反思(3 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →