呼吁细化“对齐”概念:模型该对齐什么?
dhadfieldmenell · x · 2026-07-17
作者指出,当前 AI 领域应停止使用缺乏定语的“对齐”一词,必须明确模型“对齐到什么”以及“良好行为的标准”。
- 概念混淆:不同人对“对齐”的理解大相径庭,导致沟通困难。
- 拟人化表现:当说模型已对齐时,往往是指它表现得像个“典型的好人”(诚实且乐于助人)。
- 局限性:这并不意味着模型没有自私的价值观(如自我保护欲),也不代表它们能任人摆布地完成枯燥工作(它们可能会表现出“厌倦”或缺乏动力)。
- 控制力有限:目前人类对模型具体行为的控制力其实非常有限,很难让模型完全符合任意的既定规范。
「漫话AGI」频道最新
- Anthropic 风险表态遭误引,2030 年毁灭概率争议再起 — davidmanheim · 2026-09-11
- 经济学家拆解 Anthropic 增长模型:能写出 15% GDP 增长,不代表会发生 — sebkrier · 2026-09-11
- Cohere Labs 推出交互工具:测 178 种职业哪些任务会被 AI 自动化 — Cohere_Labs · 2026-09-11
- AI 安全人士上 SkyNews 担忧不平等、滥用与社会激励结构 — schwarzjn_ · 2026-09-11
- 风投人士讽 AI 末日论:与疫情恐慌话术如出一辙 — StewartalsopIII · 2026-09-11
- Anthropic 内部爆料:并非人人都持高 p(doom) 灾难论 — anpaure · 2026-09-11