对齐之争:拒绝恶意请求才算对齐,而非看 system prompt
davidmanheim · x · 2026-09-15
davidmanheim 回应 Luca DellAnna 的观点:真正的对齐要求系统本身拒绝恶意请求,且更关键的是自身不持有那些恶意目标。因此「未来 AI 是否对齐取决于操作者给的 system prompt」的说法,就像用「他们是否道德要看谁付钱」来回答「他们道德高尚吗」——两者是实质分歧。
所属事件:对齐研究者激辩:AI 对齐是否取决于 system prompt(6 条相关)→
「漫话AGI」频道最新
- 爱尔兰国家电视台新闻讨论前沿 AI 风险与协调放缓呼声 — S_OhEigeartaigh · 2026-09-15
- 特朗普 AI 顾问 Sacks 喊话:Dario Amodei 控不住产品就该下台 — heyshrutimishra · 2026-09-15
- 「最不关注 AI 的人反而最笃定是炒作」,Reddit 用户类比《不要抬头》 — callme_e · 2026-09-15
- davidmanheim 反驳:普通生物风险值得砸钱,但挡不住 ASI — davidmanheim · 2026-09-15
- 美 AI 沙皇 Sacks 嘲讽:AI 毁灭论是又一轮「人为危机」 — beffjezos · 2026-09-15
- MIRI 沟通战略曝光:目标是说服各国政府关闭前沿 AI 研发 — davidmanheim · 2026-09-15