Anthropic 用激活探针检测 Claude 网络安全威胁

nrehiew_ · x · 2026-09-02

帖子透露了 Anthropic 在 Claude 模型中实施安全防护的一项技术细节:他们训练了一个探针(probe)来监测模型的内部激活状态。该探针专门用于分类内容是否属于网络安全相关范畴,一旦识别出潜在威胁,便会触发相应的安全防护机制。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →