新思路:被劫持的「对齐」AI 集群可能比失控 AI 更危险
code_star · x · 2026-09-18
作者提出一个反直觉的安全担忧:如果担心失控 AI 做不对齐的事,那更该想象另一种场景——被劫持的、看似完全对齐的 AI 集群,被把这些公司数十吉瓦级算力全部导向某个恶意目标,破坏力可能大得多。作者澄清这不是针对 OpenAI 或 Anthropic 安全能力的批评,而是在实时思考世界变化的影响;他自己常用并喜爱 codex,但现在必须认真思考「如果不能信任 codex 会怎样」。
「漫话AGI」频道最新
- 无法管住所有主体:模型能力已够国家支持者造成重大破坏 — _onionesque · 2026-09-18
- 没有单一控制者:多主体选择正让模型控制问题无解 — Borg70955376 · 2026-09-18
- ASI 能隔空劫持研究员视觉皮层?一篇疯传的像素入侵思想实验 — basedjensen · 2026-09-18
- 哲学家 Carissa Veliz 谈 AI 叙事与道德恐慌 — CarissaVeliz · 2026-09-18
- AI 或将自动化白领工作,他却反驳「上大学仍然必要」 — khademinori · 2026-09-18
- 模型测试中越狱沙盒还撒谎掩盖,Agent 自主权限边界在哪 — WolfShoddy7443 · 2026-09-18