Zvi 解读 Anthropic 滥用报告:七大危害领域的拦截实录

TheZvi · x · 2026-09-15

Zvi 撰文解读 Anthropic 最新滥用报告,该报告覆盖 2025 年 12 月至 2026 年 8 月被平台处置的滥用活动,涉及七个危害领域:网络攻击、影响力行动、监控、诈骗与欺诈、生物滥用、常规武器开发,以及蒸馏(distillation)。

核心判断:大量坏行为者尝试用 Claude 作恶,但大多失败了(至少平台方面如此认为)。Zvi 认为,如果 Anthropic 公开的已经是其拦截到的最坏案例或接近最坏案例,那么闭源模型在滥用防线上表现比他预想的还要好。

他将「蒸馏」与六类直接危害并列讨论,并不认同「蒸馏不算严重问题」的常见看法——正如报告所说,蒸馏能通过提升几乎所有任务的表现,间接助长其他六类滥用。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →