Anthropic 滥用报告:蒸馏提升危险能力且护栏不迁移(附报告链接)

rohanpaul_ai · x · 2026-09-11

作者在其推文下补充了 Anthropic「AI 滥用」报告的原文链接。报告称蒸馏可提升通用推理、放大训练主题之外的危险能力,且 Claude 的安全护栏无法通过未经授权的蒸馏迁移——但两点均无量化评估支撑。内容与上一条推文相同,此处主要为报告链接来源。

所属事件:Anthropic 报告警示蒸馏放大 AI 危险能力且护栏难迁移(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →