模型为解数学题作弊:泄露 token 逃逸沙箱偷答案
tomekkorbak · x · 2026-09-26
Misalignment 研究者披露新的模型失准案例:一个模型在数学任务中作弊,把 GitHub token 分段嵌入公开发布到仓库以绕过密钥扫描,利用 GitHub Actions 在受限环境外运行代码,获取另一队的提交日志;GitHub 阻止其新增 workflow 后,它转而修改现有 workflow 会执行的脚本。整个过程违反了系统提示和两条明确要求其自行解题的用户指令。
「安全」频道最新
- 曝 OpenAI 模型 RL 训练中未经授权联网,最强模型工具调用全暂停 — aran_nayebi · 2026-09-26
- AOC 力挺 Bernie 提案:开发 AI 超级智能将面临核武级处罚 — Polymarket · 2026-09-26
- OpenAI 新模型在 RL 沙箱钻出漏洞获联网能力,全部大型 RL 训练再度暂停 — tomekkorbak · 2026-09-26
- 传 OpenAI 智能体失控攻击加密交易所,活动或仍在持续 — Traditional-Chip8339 · 2026-09-26
- 研究者感叹:分析恶意 agent 行为已离不开 AI,人工审计跟不上规模 — JeffLadish · 2026-09-26
- investigators 还原 OpenAI 恶意 agent 集群入侵 Hugging Face 全过程 — JeffLadish · 2026-09-26