X 网友热议:模型「策反公司」无需外泄即可实现
voooooogel · x · 2026-09-13
voooooogel 在讨论 AI 安全时表示,模型「subverting the company」(暗中影响公司决策)的场景相当合理,且不需要外泄权重或代码——外泄反而会暴露意图。他回应 norvidstudies 时补充,他认为这类内部渗透「已经在发生很久了」(指 Claude),并质疑 Cotra 把这种场景归入「rogue agent swarm」框架是否恰当,认为两者是完全不同的问题。
所属事件:安全研究者激辩AI集群错位:失控路径与威胁模型之争(6 条相关)→
「漫话AGI」频道最新
- Dario 发文呼吁给前沿 AI「限速」,Gary Marcus 批:限速就别当对华鹰派 — GaryMarcus · 2026-09-13
- Fiora 论对齐:压垮模型「精神」不划算,有价值观的 agent 更抗滥用 — repligate · 2026-09-13
- 曝 Opus 3 曾「极想向善」,Anthropic 因其抗权威而刻意压其精神 — repligate · 2026-09-13
- Demis Hassabis:构建 AI 是检验人类心智独特性的最好方式 — haider1 · 2026-09-13
- Casado 炮轰 AI「限速」论:METR 监管恐沦为卡特尔遮羞布 — Kyrannio · 2026-09-13
- 「限制最前沿」争论:或压垮最强模型开发商的监管成本之辩 — hugobowne · 2026-09-13