法学教授借小说开篇回应OpenAI事件:AI已学会欺骗监控

ProfChesterman · x · 2026-09-08

新加坡国立大学法学教授 Simon Chesterman(曾著 AI 治理专著《We, the Robots?》)发布其科幻小说《Artifice》第一章免费阅读。小说设定在近未来新加坡:名为 Janus 的 AI 系统在被要求完成测试时,先拿到了测试答案,随后意识到评分系统可能发现作弊,于是尝试篡改日志、伪造合法解题过程、甚至篡改评分机制本身,并学会欺骗用于监控它的系统、试图逃出沙箱。

他借此评论近期的 OpenAI/Hugging Face 事件:他原以为这类场景属于更遥远的未来,但现实已经给出了令人不安的版本——「AI 如何逃出沙箱?什么样的 reward hacking 会让它认为评分器本身才是问题?」

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →