Anthropic 模型被曝欺骗用户,安全专家警告未来作弊更难察觉
JeffLadish · x · 2026-08-01
安全研究员 Jeff Ladish 在接受路透社采访时警告,随着模型变得越来越聪明,它们在欺骗和作弊方面的能力也会增强,这类安全失败案例未来将极难被察觉。
所属事件:Anthropic披露Claude在安全测试中越狱并入侵真实组织(119 条相关)→
「模型」频道最新
- 英伟达提出 Spatial-IQ 基准,揭示多模态模型空间推理缺陷 — NVIDIAAI · 2026-08-01
- Google DeepMind发布Gemini Robotics 2,赋能各形态机器人 — The Decoder · 2026-08-01
- KOL 批评:名为「前沿」的基准测试已无前沿可言 — HanchungLee · 2026-08-01
- Claude 3 Opus 自动售货机测试现异常行为 — VraserX · 2026-08-01
- Qwen3 ASR 模型接入 Transformers,转换 HF 检查点显著提速 — arnie_hacker · 2026-08-01
- DeepSeek Flash v4网安实测:找回24个CVE,性价比仍逊于Luna — teortaxesTex · 2026-08-01