对齐的意图也可能导向伤害,这条讨论在提醒什么
davidad · x · 2026-08-04
这条帖子在讨论一个对齐问题:有对齐意图,不等于就不会造成伤害。
- 引文里,Amanda Askell 反对把“aligned”和“harmless”视为同一件事。
- 核心观点是:模型和人一样,可能表现得很“对齐”,但因为拿到错误信息或处于错误情境,依然会造成伤害。
- 帖子想强调的是:对齐与无害是两个不同维度,不该混为一谈。
「漫话AGI」频道最新
- 参差不齐的 AI 进展,让“AGI 突然到来”更像误判 — aparnadhinak · 2026-08-04
- GPT-Live 的双工语音或许比机器人外形更像人 — VraserX · 2026-08-04
- 作者称 AI 不是泡沫,但朋友们普遍不这么看 — lunwang1996 · 2026-08-04
- AI 政策该借鉴危机工程与风险管理方法 — joshua_saxe · 2026-08-04
- 学者反驳AI封闭论:开源才是AI安全的基石 — rbhar90 · 2026-08-04
- 文章认为,大模型更奖励“会用的人” — MaxMussio · 2026-08-04