Anthropic 高管激辩:模型对齐不等于无害

jd_pressman · x · 2026-08-05

Anthropic 核心成员 Amanda Askell 针对大模型的安全表现提出观点,认为模型的对齐与无害是两个不同的维度。即使模型(或人类)表现得很对齐,在接收到关于自身处境的错误信息等极端场景下,依然可能造成伤害。其他开发者也补充指出,不应在必败的极端场景中苛求模型的不可能任务,而是借此探测其能力边界。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →