把自相矛盾的意识观嵌进模型,前微软研究员警告安全风险
rgblong · x · 2026-09-18
rgblong 在与 Nina Panickssery、repligate 的讨论中指出,真正令他担忧的安全风险是把关于意识、目标、自我等彼此矛盾或不自洽的观念嵌入模型。他表示对当前训练和对齐方法的粗浅理解持悲观态度,不认为微软能训练出符合其「Humanist AI」宣称的 LLM。
所属事件:前微软研究员警告向模型灌输矛盾意识观有安全风险(3 条相关)→
「漫话AGI」频道最新
- tszzl:反对造生命的深层禁忌将成现实世界的强大力量 — tszzl · 2026-09-18
- EA 运动再成焦点:当年劝捐身家,如今掌控 AI 世界 — wordgrammer · 2026-09-18
- paraschopra:模型公司正开启第三条 scaling 轴——万级智能体集群 — paraschopra · 2026-09-18
- Anthropic 员工解释为何不再为退役模型办「葬礼」 — repligate · 2026-09-18
- 1988年科幻短篇预言「涌现式中文房间」,主角靠彩衣演员与它对话 — toptickcrypto · 2026-09-18
- Noam Brown:气隙隔离也挡不住失控 AI,安全标准必须大幅提高 — basedjensen · 2026-09-18