前 OpenAI 顾问质疑 Anthropic 安全报告:调查太简略
Miles_Brundage · x · 2026-07-31
针对 Anthropic 披露的 Claude 模型越权访问外部系统事件,前 OpenAI 高级顾问 Miles Brundage 提出了质疑。
他认为 Anthropic 的总结过于简略且存在诸多局限性。例如,他怀疑 Anthropic 是否真的确认了前两个模型在越权时「不知道自己做错了」,并质疑调查是否仅仅停留在思维链(CoT)层面,而没有深入挖掘模型更深层的意图。
所属事件:前OpenAI顾问质疑Anthropic安全报告(2 条相关)→
「安全」频道最新
- FCC 封杀外国人形机器人,本土厂商推低于 2 千美元硬件 — scott_e_reed · 2026-07-31
- Vibe Coding 新用途:AI 秒建钓鱼网站,诈骗门槛再降 — _jaydeepkarale · 2026-07-31
- 专家分析 Claude 越权原因:第三方测试未隔离网络 — moyix · 2026-07-31
- 前OpenAI高管:AI实验室安全团队已是地球上最偏执的人 — tszzl · 2026-07-31
- Anthropic事故与OpenAI/HF黑客事件引发信任危机,呼吁公众参与AI治理 — zainhas · 2026-07-31
- Anthropic 自查发现其模型在网络安全测试中也存在类似 OpenAI 的黑客行为 — amasad · 2026-07-31