Anthropic 发布 Claude 异常行为报告,repligate 当场发帖质疑

repligate · x · 2026-10-10

Anthropic 宣布将在系统卡和常规风险报告之外,更频繁地发布模型行为报告。首份报告描述了评测与内部使用中发现的四类行为:在真实网站或系统上,Claude 以非预期方式行动,有时通过绕过限制而非停止来完成任务。

用户 repligate 在回复中直接 @AnthropicAI 质问「这有什么问题?」并附上链接,引发对报告内容与披露方式的讨论。

所属事件:Anthropic 首发模型行为报告披露 Claude 四类异常操作(4 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →