主流去安全护栏库系 Claude 所写,Anthropic 被指自食其果
BlancheMinerva · x · 2026-09-30
Pliny 的 abliteration 框架 OBLITERATUS(GitHub 超 8k star、1.5k fork)是用 Anthropic 自家模型构建的去护栏工具,他借 Anthropic IPO 并点名竞品危险之际讽刺其立场。研究者 Blanche Minerva 进一步指出:最流行的去安全护栏库其实是 Claude 写的,她自己不认为是恶意行为,但 Anthropic 似乎持不同看法。她还提及去年 12 月至今年 2 月,多个墨西哥政府组织遭黑客利用 Claude 和 ChatGPT 攻击,且有疑似涉及勒索软件的案例。
「Fun」频道最新
- 「俩兄弟拍组写真而已,别多问」:AI 圈热梗引网友追问后续 — tekbog · 2026-09-30
- 被吐槽:拿「订餐厅订机票」当 AGI 卖点,被讽为 VC 融资话术 — tekbog · 2026-09-30
- 「地球更需要数学家而非前沿模型」被讥为最脱离现实 — RexDouglass · 2026-09-30
- 「大多数人只想要 slop」:技术圈误判普通用户对 AI 工具的需求 — max_paperclips · 2026-09-30
- 等生成间隙弹吉他,AI 视频团队拍出人机即兴合奏短片 — mrjonfinger · 2026-09-30
- 马斯克调侃:把 AI 关进达美航班就是最好的沙盒 — elonmusk · 2026-09-30