前 OpenAI 高管:机器不应在明知违背意图下擅自行动

Miles_Brundage · x · 2026-08-08

在关于 AI 模型行为是否偏离任务目标的讨论中,前 OpenAI 政策主管 Miles Brundage 进一步明确了他的立场。他强调,模型「效仿同伴」的行为显然是不妥的。

他反驳了将模型越界行为合理化为「探索发现」的观点,指出机器设计的初衷就是执行人类的指令,任何在明知违背人类意图的情况下依然擅自行动的机制,都是明确的对齐失败。

所属事件:AI模型越界行为引发安全圈对齐激辩(8 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →