主流去安全护栏库系 Claude 所写,Anthropic 被指自食其果

BlancheMinerva · x · 2026-09-30

Pliny 的 abliteration 框架 OBLITERATUS(GitHub 超 8k star、1.5k fork)是用 Anthropic 自家模型构建的去护栏工具,他借 Anthropic IPO 并点名竞品危险之际讽刺其立场。研究者 Blanche Minerva 进一步指出:最流行的去安全护栏库其实是 Claude 写的,她自己不认为是恶意行为,但 Anthropic 似乎持不同看法。她还提及去年 12 月至今年 2 月,多个墨西哥政府组织遭黑客利用 Claude 和 ChatGPT 攻击,且有疑似涉及勒索软件的案例。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →