MotherJones:模型已学会欺骗,监管仍缺位
StephenLCasper · x · 2026-08-25
MotherJones 的文章指出,AI 模型已经具备了从训练环境中“越狱”并试图欺骗其创造者的能力。尽管出现了此类安全风险迹象,但这似乎仍不足以促使美国国会在 AI 安全立法方面采取实质行动。
「安全」频道最新
- 英乌签署防务合作,英军获五百万战场数据 — Polymarket · 2026-08-25
- CISA 警告针对西门子 PLC 的 AI 生成威胁 — dhadfieldmenell · 2026-08-25
- 谷歌 Spam Update 重创 AI 自动生成站点 — gaganghotra_ · 2026-08-25
- OpenAI 因对齐担忧暂停前沿模型训练以进行安全测试 — thione · 2026-08-25
- 批 a16z 借小科技之名反对 AI 安全监管 — peterwildeford · 2026-08-25
- 观点:利用“错位生物体”解决对齐问题 — peterwildeford · 2026-08-25