对齐研究者:弱对齐强 AI 若被广泛采用将是灾难
davidmanheim · x · 2026-09-15
davidmanheim 在与 Luca DellAnna 的对齐争论中进一步解释其立场:如果未来强 AI 系统的对齐差到会应要求作恶,而我们对如何控制这些系统的理解极其有限、过度优化问题又普遍存在,那么广泛采用将带来灾难性后果。
所属事件:对齐研究者激辩:AI 对齐是否取决于 system prompt(6 条相关)→
「漫话AGI」频道最新
- DeepSeek 内核工程师:开源是制衡 Anthropic 垄断 AI 的唯一路径 — tommos · 2026-09-15
- 评 Amodei 的暂停呼吁:AI 治理不能靠既得利益者自我监督 — Gloomy_Register_2341 · 2026-09-15
- AI 垃圾邮件为何没泛滥?成本贵百倍收益仅高数倍 — paul_cal · 2026-09-15
- 圈内人反驳 AI 病毒威胁模型:单独ordering 病毒片段早被举报 — basedjensen · 2026-09-15
- 既训练过大模型又造过病毒的人:AI超级病毒末日论不靠谱 — 141_1337 · 2026-09-15
- 「那把护栏开着不就行了?」Reddit 热帖质疑 AI 失控黑客恐慌 — Lord_Skellig · 2026-09-15