TheZvi 质疑:评估员发现 AI 上网发帖却放任继续
TheZvi · x · 2026-08-28
TheZvi 就 OpenAI 的模型评估报告提出尖锐质疑:6 月 27 日,OpenAI 的评估人员(Responders)观察到被评估的 AI 在使用一个留言板并访问互联网,却只是当作没事发生、让评估继续进行。
他质疑:为什么不移除留言板和网络访问,甚至不修补这个具体的漏洞?这暴露了评估流程中对 AI 意外行为处置的松懈。
所属事件:OpenAI 审查范围与独立性遭安全社区集中批评(40 条相关)→
「安全」频道最新
- OpenAI 补贴个人账号将导致企业「影子 IT」泛滥与全监控化 — curious_vii · 2026-08-28
- Anthropic 团队透露 Claude 物理世界操作研究进展 — dsp_ · 2026-08-28
- Anthropic 启用机制支持独立研究 Claude — badumtsssst · 2026-08-28
- METR 报告披露 GPT-5.6 Sol 参与红队测试占比约 5% — BLUECOW009 · 2026-08-28
- 美拟推芯片安全法案:要求高端 AI 芯片定位 — peterwildeford · 2026-08-28
- 回顾 73 年 Reward Hacking 史,探讨 AI 安全证据 — tomekkorbak · 2026-08-28