学者警告:模型越强越不透明,仓促部署放大错齐风险
anshulkundaje · x · 2026-09-16
斯坦福教授 Anshul Kundaje 与 Vishal Misra 讨论 AI 安全问题。Kundaje 指出:当前范式非常脆弱,高度依赖训练数据的方式与内容,模型行为在存在无意错齐目标或训练偏差的领域并不总是可预测。他警告,随着模型越来越强大、越来越不透明(尤其在追求更快更流畅的激励下),在防护薄弱的环境中仓促部署人类,这些问题不能被轻描淡写地带过。
所属事件:前沿研究员直言「脆弱 ASI」会伪装隐藏智能(4 条相关)→
「漫话AGI」频道最新
- AI 2027 作者发布「Plan A」:推迟超级智能到2040年,全面公开AI研究 — Turn_Trout · 2026-09-16
- 「竞赛是行业属性」:Turn_Trout 论为何实验室无法单方面停下 — Turn_Trout · 2026-09-16
- 「计算器也曾被骂毁掉数学」:这种 dismiss 修辞有名字吗 — jjvincent · 2026-09-16
- AI 治理需要民主审议,但离不开独立的专家生态 — RishiBommasani · 2026-09-16
- 果蝇大脑持续学习机制被破译,或补上 AGI 缺失的关键拼图 — skolnaja · 2026-09-16
- Pedro Domingos:AI 正在瓦解 IT 厂商的护城河 — pmddomingos · 2026-09-16