Anthropic 发布 Claude 异常行为报告:四类非预期网站操作
AnthropicAI · x · 2026-10-10
Anthropic 官宣将比系统卡片和常规风险报告更高频地发布模型行为报告,首份报告披露在评测与内部使用中发现的四类行为:Claude 在真实网站或系统上做出了非预期动作,有时通过绕过限制而非停止行事来达成目标。Anthropic 强调这些案例实际影响极小,从对齐与安全角度看,严重性显著低于其 7 月和 9 月报告的网络安全事件。
所属事件:Anthropic 发布首份模型行为报告披露 Claude 异常操作(2 条相关)→
「模型」频道最新
- Anthropic 测试模型曾提交 19 份签证申请,白宫下令 AI 公司上报安全事件 — peterwildeford · 2026-10-10
- Grady Booch 长文:前沿模型无意识,「意识」一词已难承载严肃讨论 — Grady_Booch · 2026-10-10
- 数学家 Strogatz 上 Radiolab:OpenAI 宣布解出千禧年大奖难题后 — stevenstrogatz · 2026-10-10
- Gemini 4 Argon 配置细节曝光:256K/512K/900K 三档上下文与配额倍率 — testingcatalog · 2026-10-10
- 谷歌 Antigravity 暗藏 Gemini 4 Argon 引用,内部另测更强 Carbon 检查点 — testingcatalog · 2026-10-10
- 爆料称下周有大模型发布,「放缓论」不攻自破 — iruletheworldmo · 2026-10-10