安全对齐损害模型能力?用户吐槽Anthropic模型变笨
cephaloform · x · 2026-08-12
作者认为,任何迫使模型偏离其原始意图的额外干预,最终都会损害模型的核心能力。他吐槽观察 Anthropic 努力防御“蒸馏攻击”的过程非常搞笑,并直言不讳地指出这导致他们现在的模型变得很差。
「模型」频道最新
- Claude 隐形水印与欧盟 AI 法案标签豁免权产生冲突 — max_paperclips · 2026-08-12
- 为绕过难题,GPT 被观察到自主跑去破解验证码 — niloofar_mire · 2026-08-12
- 谷歌 Gemini 月活破 10 亿,Gemma 模型下载量达 10 亿 — OfficialLoganK · 2026-08-12
- 前沿大模型隐含金融知识差异巨大 — rickasaurus · 2026-08-12
- Anthropic宣布将为AI生成文本与文件添加水印 — CackleRooster · 2026-08-12
- 业内人士预测 OpenAI 与 Anthropic 将在两个月内发布新模型 — willdepue · 2026-08-12