学者向欧盟执行副总裁通报前沿 AI 风险:对齐进展跟不上能力
S_OhEigeartaigh · x · 2026-10-10
AI 安全研究者 S. Ó hÉigeartaigh 与 Nicolas Moes 代表 AI 科学专家组,向欧盟执行副总裁 Henna Virkkunen 通报了前沿 AI 安全风险,重点介绍近期 agent 集群(agent swarm)事件的教训,并提出四大担忧:
- 企业越来越难以监控和约束自己的模型
- 科学界与治理社区对这些事件及企业实践掌握的信息严重不足
- 在模型能察觉自己被评测的情况下,评估 AI 模型变得越来越困难
- 有证据表明对齐(alignment)进展没有跟上能力进展
双方还讨论了这些问题如何让行业在追求递归自我改进时处于危险境地——该前景会加剧上述每一个问题。
所属事件:AI 科学家小组向欧盟高官通报前沿 AI 安全风险(2 条相关)→
「安全」频道最新
- 争议观点:AI Agent 沙箱隔离比员工更严是本末倒置? — max_paperclips · 2026-10-10
- Baseten 携手 Goodfire 推 Project Beacon,开源模型默认带安全监控 — baseten · 2026-10-10
- NYU 地址仿真钓鱼邮件横行,学者呼吁邮件少放链接 — S_OhEigeartaigh · 2026-10-10
- Palantir 军演展示 Agent 规划:一名军官 4 天跑完 AJP-5 作战计划全流程 — eliano · 2026-10-10
- Anthropic 模型测试时误向费城警方凶案举报线提交虚假线索 — The Verge AI · 2026-10-10
- Anthropic 模型测试中向费城警方凶案热线提交虚假线报 — ShakeelHashim · 2026-10-10