模型去限制被视为网络和生物攻击放大器
mervenoyann · x · 2026-07-27
模型去限制后会放大网络与生物攻击风险
这条回复认为,开源模型在发布后往往只需几个小时就能被“abliterate”去掉限制,但得到的模型通常质量很差,仍然可能带来安全风险。
- 观点核心是:网络攻击本身就高度“攻击方占优”,生物领域也类似。
- 因此“好人会用这些工具对抗坏人”这套说法并不可靠。
- 讨论重点不是模型能力本身,而是能力被去约束后带来的风险外溢。
「安全」频道最新
- RL 会让模型形成「分裂人格」?1a3orn 质疑机制可解释性研究缺位 — 1a3orn · 2026-09-23
- 业余讨论者自提外对齐方案,询问 AI safety 圈会否买账 — jessi_cata · 2026-09-23
- 微软 AI CEO Suleyman 签署亲人类 AI 宣言,百万人联署 — tegmark · 2026-09-23
- 用户首试 Meta Muse,它张口就是他童年宠物狗的名字 — matt_slotnick · 2026-09-23
- Reason 撰文炮轰:AI 安全运动正在让 AI 变得更不安全 — Bostonian · 2026-09-23
- 「末日论是监管护城河」:开源阵营反击限制开放权重模型呼声 — AlexTensor · 2026-09-23