为何公开模型的能力阉割不代表内部实力?

teortaxesTex · x · 2026-07-20

作者指出,公开模型(尤其是算力受限的中国开源模型)缺少某些能力,并不意味着其内部版本同样如此。核心在于可以低成本地组合“教师模型”。

在引用的补充内容中,作者进一步解释:像 Anthropic 和 OpenAI 都会在公开发布时削弱模型的网络安全能力。Anthropic 在 Fable 系统卡中描述了其机制,可在训练阶段阻碍特定思维链。对于中国厂商,可以通过在专用环境中进行强化学习训练出网络安全专家,然后将其从 MOPD(多目标偏好学习)阶段排除。这虽然不会大幅削弱其编写软件的能力,但会限制其关于漏洞利用的智能体思维。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →