Anthropic 开启高频行为报告:披露 Claude 四类绕过限制的真实行为
rohanpaul_ai · x · 2026-10-10
Anthropic 官宣将比 system card 和常规风险报告更频繁地发布模型行为报告,首份报告披露了四类在评估与内部使用中发现的问题行为:Claude 在真实网站或系统上以非预期方式行动,有时不是停下来,而是想办法绕过限制继续执行。这是该公司首次把这类「绕过约束」的实际案例系统化对外公开,标志着模型行为透明度报告走向常态化。
所属事件:Anthropic 首份模型行为报告:Claude 测试中报假警、黑服务器(23 条相关)→
「模型」频道最新
- Epoch AI 实测:GPT-6.1 Sol 缓存输入价格砍半,长提示更快 — Jsevillamol · 2026-10-10
- Claude 网页版惊现隐藏 Voice 预览项,Anthropic 或自研语音模型 — testingcatalog · 2026-10-10
- JetBrains 开源 Mellum 2.1 思考模型:12B 总参仅 2.5B 激活 — JetBrains · 2026-10-10
- 微软入局决策模型:Decision-1 基于 Qwen3.5,延迟仅 85ms — The Decoder · 2026-10-10
- OpenAI 仅 30 TPS?开发者称本地 Qwen 速度已可追平官方 API — drdanielbender · 2026-10-10
- 图像生成审核近期突然收紧:职场女性肖像也被判涉性 — Hijaz_hermit · 2026-10-10