安全圈联名发声,Gary Marcus:对齐无保证终于有人承认了
GaryMarcus · x · 2026-09-30
- 一批知名 AI 安全研究者(含前 DeepMind 的 Geoffrey Irving 等)联名发声,指出一个掷硬币级别的风险判断:默认训练出的模型当然不会对齐,我们必须非常努力去对齐它们,而目前我们对如何做到这一点「完全没有任何好的保证」。
- 长期批评大模型对齐现状的 Gary Marcus 转发表示,这正是他多年来反复说的观点,并希望既然圈内人终于亲口承认,更多人会开始相信这一判断。
「漫话AGI」频道最新
- 开发者喊话:常驻 AI 智能体必须开源 — yacineMTB · 2026-09-30
- 微软用强化学习训练「夜科学」智能体,科研方向扩展 27.8% — MicrosoftResearch · 2026-09-30
- 「要有品味,你得先吃」:AI 圈流传的审美金句 — jxnlco · 2026-09-30
- 有人担心 AI 音乐视频变成超级说服力武器 — zetalyrae · 2026-09-30
- Anthropic 发起 AI 公众大调查:8.1 万人参与后再度启动 — AnthropicAI · 2026-09-30
- OpenAI 推出 agent 原生办公套件 Space,文档表格幻灯片进 ChatGPT — danshipper · 2026-09-30