「不想我和家人死」≠「不想人类灭绝」:两种对齐目标天差地别
shakoistsLog · x · 2026-09-10
作者提醒:"我主要不想让我的家人朋友死"与"我主要不想让人类灭绝"是两种截然不同的目标函数,对应的安全政策含义也完全不同。前者是局部、个人化的保护目标,后者才是全局性的存在风险评估——对 AI 对齐目标的措辞差异会直接导向不同的治理与政策选择。
「安全」频道最新
- 与其再做 SaaS,不如办一场 AI 安全主题黑客松 — tristanbob · 2026-09-10
- Google 高官表态:Gemini 4 将持续冲击网络安全前沿 — OfficialLoganK · 2026-09-10
- 谷歌发布 Gemini 3.8 Flash Cyber 网络安全模型,自动挖洞并生成补丁 — OfficialLoganK · 2026-09-10
- Mira Murati同事质疑:为何不能付费让不安全模型帮你渗透测试 — DavidSHolz · 2026-09-10
- 马萨诸塞州拟要求 25MW 以上数据中心配清洁能源或缴保护基金 — rohanpaul_ai · 2026-09-10
- Anthropic 就风险争议发声明,业内人士吐槽「AI 可能毁灭人类」的公关话术 — Miles_Brundage · 2026-09-10