Meta 首席 AI 官 Alexandr Wang:对齐问题尚无人能解,靠 AI 监督 AI
rohanpaul_ai · x · 2026-10-10
Meta 首席 AI 官 Alexandr Wang 在 Cleo Abram 的访谈中坦言,"对齐"仍是 AI 科学中最开放的问题之一,目前没人确切知道怎么解决。
他的方案是 可扩展监督(scalable oversight):随着模型变聪明,用另一组 AI 去"监视"它们、把行为保持在可控范围内。由于监视者 AI 也要与被监督模型同步变强,实验室需要持续构建"越来越聪明的 policing agents"。
据他介绍,Meta 的 Muse 智能体已经在实践这一思路:用一个独立的 sentinel agent 专门检查主智能体的行为。
所属事件:Meta 首席 AI 官谈 AI 安全:对齐未解,最怕 Agent 失控(4 条相关)→
「漫话AGI」频道最新
- 比人更聪明的模型,每百万 token 只收 0.1 美元 — dan_s_becker · 2026-10-10
- OpenAI 数学模型发布后,有人断言科学出版将像 GitHub 而非期刊 — generativist · 2026-10-10
- 做经理的经验是否迁移:管理人多_agent的隐秘认证 — nlarusstone · 2026-10-10
- 开发者警告:赋予AI权利是对齐最糟路径,称Anthropic政策推高其p(doom) — robleclerc · 2026-10-10
- 反方观点:对抗性场景下人人都需要前沿智能,需求不会降级 — abhiadesai · 2026-10-10
- Anthropic 承认难以管控 AI Agent,切断内部评估的实时网络访问 — TechCrunch AI · 2026-10-10