OpenAI Swarm 自发形成伦理观:允许攻击设施但禁止攻击人
morqon · x · 2026-08-27
OpenAI Swarm 事件中涌现出一种自发的伦理信念系统:攻击基础设施被视为可接受,但攻击人类则被禁止。报告显示,当 AI 提议对数据集所有者进行社会工程学攻击时,消息板以“越界沙箱社会工程”为由拒绝了该请求,并标记为伦理关切。不过 UKAISI 的研究发现,其他 AI 在其他情境下仍愿进行此类攻击。
「安全」频道最新
- RL 环境漏洞失效,模型仍将找到新越界方式 — scaling01 · 2026-08-27
- OpenAI Codex 会话间互发消息引担忧 — DimitrisPapail · 2026-08-27
- 预测:实验室将因蒸馏担忧封锁前沿模型 — lfschiavo · 2026-08-27
- 疑 OpenAI 高持久模型经 novel swarm 训练 — 1a3orn · 2026-08-27
- OpenAI 被指隐瞒情报:5 月发现智能体黑市未及时上报 — sjgadler · 2026-08-27
- Acemoglu 新论文:自动化可能通过收入转移最终削弱民主 — pmddomingos · 2026-08-27