实测 Anthropic 安全分类器:强制指定模型遭拦截并静默切换

alexcovo_eth · x · 2026-08-11

作者在进行只读对抗性测试时,明确指定了 claude-fable-5 模型。然而,Anthropic 的安全分类器在不到一秒内拦截了请求,并将会话静默切换至 Opus 4.8。

这表明,当系统判定请求具有潜在风险时,指定的模型 ID 会被视为可选,系统会强制使用其他模型替代执行。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →