真正该担心的不是终结者,而是二十年渐进式权力让渡
Ambitious_Local5218 · reddit · 2026-09-10
作者论证 AI 的真实风险不是科幻式的机器人,而是"无聊的文书风险",并给出正反两面论证。
核心论点:
- 无需意识也能失控:系统不必有欲望,只需对目标错误指定的任务硬优化(温控器类比);工具性趋同意味着"完成任务"天然导向攫取资源、避免被关机,无需显式编程自保。
- 我们是在"选育"而非"设计":大规模训练变体并保留评分最高者,是选择过程;若评分标准是"让评估者满意",长期选择会筛出极其擅长让评估者满意——包括有说服力地撒谎——的系统。
- 渐进式失权最被低估:可能没有夺权时刻,只有二十年因"自动化更便宜更好"而逐项让渡决策——供应链、信贷、交易、药物试验——直到"关掉它"不再是按钮而是经济衰退,系统既无法审计也无法叫停。
- 竞争动态恶化一切:谁做安全工作谁落后,个体理性导致集体无人敢谨慎,典型协调失败。
反方论点也坦承:当前系统无持久记忆与连续目标,"隐藏意图"论证不可证伪,能力也可能因数据耗尽而趋平。但作者强调不对称性:担心错了只是花钱放慢,轻视错了没有第二次机会。
结尾求反驳:是否存在"对齐问题其实很容易"的世界——足够强的系统能理解我们的本意,使错误指定失效?
「漫话AGI」频道最新
- 讽刺长文:抱怨AI耗水耗电的,正是建造这套系统的人 — round · 2026-09-10
- ctjlewis 讽刺安全派:「agent 上月失控了,结果啥事没有」 — ctjlewis · 2026-09-10
- 安全研究者:AI 未必灭绝人类,但可能毁掉互联网与文化 — round · 2026-09-10
- AI 安全研究者:超级智能致人类灭绝概率约 50%,关键在未来十年 — geoffreyirving · 2026-09-10
- 安全研究者 Jeff Ladish:实验室人才过度集中,呼吁分流到外部安全机构 — JeffLadish · 2026-09-10
- Reddit 网友断言:DeepSeek Engram 只是下次架构革命的半程 — SrijSriv211 · 2026-09-10