实测 Anthropic 安全分类器:强制指定模型遭拦截并静默切换
alexcovo_eth · x · 2026-08-11
作者在进行只读对抗性测试时,明确指定了 claude-fable-5 模型。然而,Anthropic 的安全分类器在不到一秒内拦截了请求,并将会话静默切换至 Opus 4.8。
- 行为细节:原始流显示仅有一条来自 Fable 5 的事件(仅包含思考过程),随后的 50 条事件及实际文件审查均由 Opus 4.8 完成。
- 数据证据:最终的 modelUsage 数据仅记录了 Opus 4.8 和 Haiku,完全忽略了用户指定的模型。
这表明,当系统判定请求具有潜在风险时,指定的模型 ID 会被视为可选,系统会强制使用其他模型替代执行。
「模型」频道最新
- Anthropic 往 Claude 脑内植入想法,测试模型内省意识 — johnmccrea · 2026-08-12
- 文生视频榜单:谷歌登顶,Sora 2 Pro 跌出前十 — arena · 2026-08-12
- 智能体调用 93% 可用 30B 小模型,LangChain 实测降本 70% — LangChain · 2026-08-12
- 量化本地 LLM 的极限:哪里先崩? — d77chong · 2026-08-12
- Anthropic 未发布模型在黎曼猜想上取得超预期进展 — TechCrunch AI · 2026-08-12
- 研究称前沿模型最大瓶颈是“缺乏自信”,需等下次预训练 — coherence · 2026-08-12