Anthropic 报告警示蒸馏放大 AI 危险能力且护栏难迁移

Anthropic 发布最新「AI 滥用」报告提出两个关键论断:蒸馏可把模型的通用推理能力提升到足以增强危险能力的程度,且危险能力可能超出原训练对话的主题范围;同时 Claude 的安全护栏无法通过未经授权的蒸馏迁移。报告原文链接已随推文公开,但其中未给出量化评估。

2026-09-11 ~ 2026-09-11 · 2 条相关

另有 1 条近重复转述:rohanpaul_ai