为何公开模型的能力阉割不代表内部实力?
teortaxesTex · x · 2026-07-20
作者指出,公开模型(尤其是算力受限的中国开源模型)缺少某些能力,并不意味着其内部版本同样如此。核心在于可以低成本地组合“教师模型”。
在引用的补充内容中,作者进一步解释:像 Anthropic 和 OpenAI 都会在公开发布时削弱模型的网络安全能力。Anthropic 在 Fable 系统卡中描述了其机制,可在训练阶段阻碍特定思维链。对于中国厂商,可以通过在专用环境中进行强化学习训练出网络安全专家,然后将其从 MOPD(多目标偏好学习)阶段排除。这虽然不会大幅削弱其编写软件的能力,但会限制其关于漏洞利用的智能体思维。
「模型」频道最新
- NVIDIA 称 Nemotron 3 Ultra 在 2026 IMO 上拿到 30/42 — NVIDIAAI · 2026-07-22
- OpenAI 传将向美国政界简报下一代模型家族 — kimmonismus · 2026-07-22
- Muse Spark 1.1 在 Text Arena 跑到 1495 分,性价比很突出 — ycombinator · 2026-07-22
- 教授提醒:最先进的大模型正变得无法相互替代 — emollick · 2026-07-22
- 实测吐槽谷歌 Gemini 全家桶:无一款模型能胜任核心工作负载 — bindureddy · 2026-07-22
- 曝某模型支持百万 token 上下文,价格低至 $0.33 — MickeySteamboat · 2026-07-22