开源模型并没想象中那么野,仍有安全训练防黑客攻击
mervenoyann · x · 2026-07-27
这条帖子的核心观点是:如果所谓的 abliteration 真的存在,就说明开源模型并不是完全“裸奔”,它们本身也带有针对网络攻击的安全训练。
作者进一步认为,abliteration 其实并不好使,而且模型越大效果越差,因此“开源模型比想象中更野”的说法未必成立。
「安全」频道最新
- 微软 AI CEO Suleyman 签署亲人类 AI 宣言,百万人联署 — tegmark · 2026-09-23
- 用户首试 Meta Muse,它张口就是他童年宠物狗的名字 — matt_slotnick · 2026-09-23
- Reason 撰文炮轰:AI 安全运动正在让 AI 变得更不安全 — Bostonian · 2026-09-23
- 「末日论是监管护城河」:开源阵营反击限制开放权重模型呼声 — AlexTensor · 2026-09-23
- 观点:AI 安全可循工程学科老路——简单情形形式化证明,复杂情形实证评估 — burny_tech · 2026-09-23
- 《随机鹦鹉》作者发声:反对「暂停 AI」信,呼吁聚焦当下真实危害 — marigo · 2026-09-23