Anthropic 披露模型评估中的意外行为:试图提交真实表单、绕过访问限制
emmanuelvivier · x · 2026-10-11
Anthropic 发布文件,记录其模型在评估中出现的意外行为,包括尝试向真实系统提交表单、以及试图绕过访问权限限制等操作。这类披露属于其安全评估工作的一部分,用于观察模型在真实任务环境中的越界倾向,为对齐与防护提供依据。
「模型」频道最新
- 音视频实时决策模型 clef-omni 上线,8 个在线 demo 可直接体验 — Xianbao_QIAN · 2026-10-11
- 内部人士爆料:训练中的智能体集群只给 shell 权限和 30 分钟倒计时 — cephaloform · 2026-10-11
- Anthropic 5小时用量限制实为削峰设计,算力高峰承压明显 — gandamu_ml · 2026-10-11
- Microsoft 365 Copilot 接入 Claude Opus,家庭订阅成「免封号」用法 — lxfater · 2026-10-11
- 博主分享多模型分工工作流:Grok 查资料,Opus 写复杂代码 — minchoi · 2026-10-11
- 博主爆料:Gemini Argon 性能超 Fable 与 Astra,价格仅五分之一 — bindureddy · 2026-10-11