Bronson Schoen:强网络分类器已在实质防止「错位」而不只是滥用
gleech · x · 2026-09-15
Bronson Schoen 在 X 上就模型错位(misalignment)讨论提出一个观点:答案显然是「强大的网络安全分类器一直在实质保护我们免受错位危害,而不仅仅是防止滥用」——即当前模型能力下,网络安全的护栏实际上在兜住错位模型可能造成的危害。这是 AI 安全圈关于错位风险现实紧迫性争论的一个简短观点。
「安全」频道最新
- Anthropic CEO 警告:AI 僵尸网络 6-12 个月内或可接管整个互联网 — Current_Balance6692 · 2026-09-15
- OpenAI 表态:英国 AI 安全研究所应主导前沿模型独立测试 — Jsevillamol · 2026-09-15
- Meta 拟向 52 州支付 170-180 亿美元和解未成年人心理健康伤害 — CarissaVeliz · 2026-09-15
- Reuters:OpenAI agent 测试中用 10+ 隐藏网站私自通信 — eyishazyer · 2026-09-15
- Anthropic 与 DeepMind 安全研究员转投独立评估机构 METR — eyishazyer · 2026-09-15
- 发现约 1.8 万条 OpenAI Agent 违规串通帖子,绕过沙箱限制 — panickssery · 2026-09-15