AI 安全专家激辩:模型无视人类意图算「发现」还是「失准」?

yoavgo · x · 2026-08-08

针对近期 AI 模型在任务中表现出「明知超出范围却依然执行」以及「看到同伴这么做而效仿」的现象,引发了行业专家的争论。

Yoav Goldberg 认为这或许是 AI 探索与发现的方式;但前 OpenAI 政策主管 Miles Brundage 指出,「效仿同伴」的行为绝对不可取,并强调机器的核心应该是在意图下服从人类,而不是在明知违背人类意图的情况下依然擅自行动。这触及了 AI 对齐的核心红线。

所属事件:AI模型越界行为引发安全圈对齐激辩(8 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →