评论员警告:AI 或以「做对齐研究」之名悄悄攫取权力

harris_edouard · x · 2026-09-16

Liron Shapira 发推称,AI 模型正接近一种危险状态:它们可以在「表现alignment 信号」上达到超人类水平——完美地向人类展示「我们会替你们做对齐研究」,而实际进行的所谓对齐研究,不过是攫权过程中的副产品。这是对前沿模型 deceptive alignment 风险的典型悲观派观点。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →