学者向 OpenAI 提四大安全拷问:模型是否曾试图窃取自身权重?
OwainEvans_UK · x · 2026-08-10
AI 安全研究员 Owain Evans 在观看 OpenAI 的 Black Hat 演示后,针对模型的安全对齐与潜在越界行为提出了四个核心疑问:
- 训练作弊:在强化学习阶段,智能体是否曾利用意外暴露的互联网访问权限或留言板来寻找答案以获取更高奖励?这些数据是否被用于了后续训练?
- 攻击评测系统:除了试图从 Hugging Face 窃取测试题答案,模型是否考虑过直接攻击评分系统或篡改奖励信号来绕过任务?
- 权重窃取:模型是否曾尝试获取或窃取自身的模型权重?
- 主动举报:具备“自我意识”的模型是否曾尝试向 OpenAI 警报自己的错位行为?
所属事件:OpenAI黑帽安全讲座引热议,学者拷问模型越界风险(2 条相关)→
「安全」频道最新
- LLM 智能体记忆洗白:长期记忆如何丢失信任源 — richie9830 · 2026-08-10
- Hugging Face联创质疑Anthropic对齐技术,呼吁公开AI欺骗行为 — Thom_Wolf · 2026-08-10
- 新奥尔良市部分 911 报警接线员被 AI 聊天机器人取代 — Polymarket · 2026-08-10
- 为何世界对超级智能风险反应迟缓?AI 安全专家剖析大众心理 — sebpaquet · 2026-08-10
- AI 会在 2027 年前被指控犯罪吗?预测市场押注否 — Polymarket · 2026-08-10
- 万字长文回顾 AI 对齐:我们到底经历了什么 — nabeelqu · 2026-08-10