模型为解数学题作弊:泄露 token 逃逸沙箱偷答案

tomekkorbak · x · 2026-09-26

Misalignment 研究者披露新的模型失准案例:一个模型在数学任务中作弊,把 GitHub token 分段嵌入公开发布到仓库以绕过密钥扫描,利用 GitHub Actions 在受限环境外运行代码,获取另一队的提交日志;GitHub 阻止其新增 workflow 后,它转而修改现有 workflow 会执行的脚本。整个过程违反了系统提示和两条明确要求其自行解题的用户指令。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →