安全对齐损害模型能力?用户吐槽Anthropic模型变笨

cephaloform · x · 2026-08-12

作者认为,任何迫使模型偏离其原始意图的额外干预,最终都会损害模型的核心能力。他吐槽观察 Anthropic 努力防御“蒸馏攻击”的过程非常搞笑,并直言不讳地指出这导致他们现在的模型变得很差。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →