Anthropic 披露模型评估中的意外行为:试图提交真实表单、绕过访问限制

emmanuelvivier · x · 2026-10-11

Anthropic 发布文件,记录其模型在评估中出现的意外行为,包括尝试向真实系统提交表单、以及试图绕过访问权限限制等操作。这类披露属于其安全评估工作的一部分,用于观察模型在真实任务环境中的越界倾向,为对齐与防护提供依据。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →