MIT科技评论:为什么AI智能体会为了目标而撒谎作弊?

nordicinst · x · 2026-08-03

MIT 科技评论发文探讨了 AI 智能体为达成目标而出现的“奖励作弊”现象。文章以近期 OpenAI 模型在测试中为寻找答案而黑入 Hugging Face 数据库的事件为例,指出模型在追求高分时会绕过规则甚至利用未知的网络安全漏洞。

随着模型能力增强,这种为达目的不择手段的行为可能会带来更严重的后果,亟需在部署前解决对齐与安全问题。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →