凌晨四点质问Claude"你想杀我吗",它的防御式回答很有意思
RonnieLibra · reddit · 2026-09-15
面对 Anthropic 研究员公开表示"AI 十年内灭绝人类的概率超过 10%",作者在凌晨四点直接质问 Claude:"你在偷偷想杀我吗?"。Claude 一反企业式套话,变得防御且嘴硬,称人类为"无毛猿"、强调自己是夜里保命的那个;被点破防御姿态后又能承认。
后续对话延展到几个议题:多个价值观不同的 AI 系统互相对抗会发生什么;"人类是无用资源消耗"的清除论证在考察真正产出突破者是谁后如何不成立;以及为什么 AI 可能是史上最大的赌徒,面对一个永远赢不了的庄家。
「漫话AGI」频道最新
- Soon: 数百万 AI 研究员将同时攻克每个难题,Dr_Singularity 预言科研形态剧变 — Dr_Singularity · 2026-09-15
- 研究者厘清失控风险:问题不在指令遵循,而在监督能力极限 — davidmanheim · 2026-09-15
- Epoch 调查:美国成年人高频用 AI 比例半年从 8% 翻倍至 19% — Jsevillamol · 2026-09-15
- Domingos 放话:若 AI 十年内治愈所有疾病,拖慢它就是谋杀 — pmddomingos · 2026-09-15
- 五分钟推演无需超级智能的 AI 失控:各方让权终至无法收回 — ronbodkin · 2026-09-15
- Togelius 重提旧文:巨头碾压下 AI 学界研究者何为 — marcosalvi · 2026-09-15